Журнал · Rit.work

Контракт навыка отделяет правильный процесс агента от правильного ответа

Авторы предлагают проверять каждый этап работы агента и отдельно измерять соблюдение процедуры, чтобы финальная точность не скрывала пропущенные действия.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Агентов научили соблюдать обязательную последовательность действий, а не только выдавать правильный итоговый ответ. В препринте Jianghan Shen и коллег, который не проходил рецензирование и содержит замеры самих авторов, Qwen3.5-4B завершал предписанную процедуру в 99,27% математических и 99,96% поисковых заданий. Для команд это даёт отдельный способ обучать и принимать обязательные этапы работы агента.

Контракт превращает навык в исполняемую спецификацию

Обычная инструкция описывает желаемое поведение текстом. Модель может пропустить часть шагов, найти короткий путь и всё равно получить правильный ответ. Если проверять только результат, такое выполнение будет выглядеть успешным.

Контракт навыка состоит из видимой инструкции и исполняющей среды. Инструкция объясняет агенту порядок работы, а среда хранит текущий этап, уже пройденные контрольные точки и допустимые следующие действия. Она также задаёт разрешённые переходы между этапами и условия, при которых агент может завершить задачу.

После каждого действия среда сверяет его с текущим этапом и наблюдениями от внешнего инструмента. Допустимое действие меняет состояние контракта или вызывает инструмент. Недопустимое отклоняется: этап остаётся прежним, а агент получает сообщение с причиной и разрешённым следующим действием.

В математических задачах контракт требует вызвать Python, изучить результат и только затем продолжить рассуждение или ответить. В поиске агент сначала запрашивает документы, затем исследует найденные материалы и при необходимости организует доказательства перед ответом. Правильный ответ без обязательных этапов не считается завершённым протоколом.

Проверка охватила пять исполнителей семейств Qwen2.5 и Qwen3.5, математику и поиск по нескольким наборам данных. Контракты для обеих областей авторы составили вручную, а результаты сравнили с обучением по итоговой награде и вариантами без отдельных частей метода. Автоматическое превращение произвольной инструкции в контракт в работу не входит.

Прогресс по этапам даёт сигнал раньше финального ответа

Для оценки процедуры авторы ввели долю завершённых протоколов, PCR. Метрика засчитывает траекторию, только если агент прошёл все обязательные этапы и завершил работу разрешённым способом. Её считают отдельно от итоговой успешности задания — правильности математического ответа или точного совпадения ответа в поиске.

Разделение нужно и при обучении. Если награда приходит только за правильный финал, несколько неудачных траекторий получают одинаковый результат, хотя одна остановилась сразу, а другая почти закончила процедуру. Алгоритму нечем определить, какую из них следует подкрепить.

Контракт начисляет награду при первом прохождении каждой проверяемой контрольной точки. Прогресс после отклонённого действия получает меньший вес, поэтому агенту выгоднее сразу соблюдать порядок. Обратная связь о состоянии контракта в награду не входит: она добавляется в контекст и подсказывает допустимый следующий шаг.

У Qwen3.5-4B итоговая успешность составила 82,95% на математике и 46,61% на поиске. Высокое соблюдение протокола не дало пропорционального роста этих показателей: контракт учит процедуре, но сам по себе не гарантирует лучший ответ.

На Qwen2.5-3B награда только за проверенный прогресс подняла PCR выше 93% в обеих областях, тогда как обучение только по финальному исходу не сдвинулось с начальной точки. При отключении обратной связи во время поиска PCR упал с 98,90% до 43,05%. Значит, обученная модель не просто запомнила порядок: в поисковых задачах она заметно опиралась на сообщения исполняющей среды.

Что придётся изменить в архитектуре агента

Работа меняет планы команд, для которых порядок действий входит в требования к продукту. К финальной проверке ответа придётся добавить явное состояние процесса, правила переходов, проверку допустимых вызовов инструментов и отдельную метрику завершения протокола. Один тест на правильность результата такую систему не покрывает.

Исполняющая среда становится частью не только обучения, но и рабочего контура. Эксперимент с отключением обратной связи показывает, что убрать её после обучения без повторной проверки нельзя. Контракт также должен получать наблюдения от инструментов, иначе он сможет проверить форму вызова, но не связь действия с внешним результатом.

Метод подходит для заранее описанных навыков, где команда может однозначно перечислить этапы и разрешённые переходы. За это приходится платить ручной формализацией каждого навыка и адаптером для конкретной среды. Причём проверяемость остаётся локальной: например, требование содержательного рассуждения в экспериментах проверяли по формальным признакам текста, а не по качеству логики.

Если продукту важен только конечный ответ, контракт добавит инфраструктуру без доказанного прироста точности. Если же агент обязан вызвать определённые инструменты, опереться на их наблюдения и не перескочить через обязательный этап, работа предлагает цельную схему: одна спецификация проверяет выполнение, формирует награду и даёт агенту обратную связь.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу