Журнал · Rit.work

Как не дать хорошему ответу скрыть плохой вызов инструмента

SLCA-GRPO разделяет сигналы для вызовов инструментов и итогового ответа, чтобы удачная формулировка не закрепляла ошибочные действия агента.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Обучение агентов с вызовом инструментов можно сделать устойчивее, если отдельно оценивать действия и итоговый ответ. SLCA-GRPO обошёл обычный GRPO на всех трёх проверочных наборах, хотя работа не рецензирована и числа получили сами авторы. Для команд это меняет не архитектуру агента, а схему наград при обучении.

Почему общий балл закрепляет неправильные действия

Агент с инструментами создаёт два разных типа результата. Сначала он рассуждает, выбирает функции, заполняет аргументы и обрабатывает ответы среды; затем формулирует итог для пользователя.

GRPO обычно назначает всей траектории одно «преимущество» — сигнал, который показывает, насколько результат лучше или хуже других попыток в той же группе. Один и тот же сигнал обновляет токены вызовов инструментов и токены итогового текста.

Из-за этого хороший ответ может скрыть плохое исполнение. В приведённом авторами случае агент сделал лишний поисковый вызов, затем запросил две цены акций последовательно вместо одного параллельного вызова, но подготовил правильное сравнение. Общая награда могла закрепить эту траекторию, хотя она тратила лишние вызовы и нарушала ожидаемый порядок действий.

Возможна и обратная ошибка: агент правильно получает данные, но неточно пересказывает их. Тогда слабый итоговый текст уменьшает общий балл и подавляет удачный способ работы с инструментом.

Проблема возникает не потому, что градиенты двух частей обязательно направлены в противоположные стороны. Диагностика показала, что направления близки к ортогональным, а нестабильность создаёт перенос шумного сигнала от текста к действиям.

Как SLCA разделяет награды внутри одной модели

SLCA делит обучаемые токены траектории на два сегмента. К первому относятся рассуждения и структурированные вызовы инструментов, ко второму — последний непрерывный блок с ответом пользователю. Токены, которые добавила среда, не обновляют модель.

Каждый сегмент получает свою награду. Для инструментов учитываются корректность выбранных функций, аргументов, формата и порядка вызовов. Для ответа оценивается качество итоговой формулировки с учётом полученных наблюдений.

Награды отдельно нормализуются внутри группы попыток. Сигнал исполнения обновляет только токены первого сегмента, а сигнал качества ответа — только токены второго. Модель остаётся единой: метод не требует отдельного планировщика, отдельного генератора ответа или дополнительных траекторий из промежуточных состояний.

Для обучения авторы также собрали SGLS — имитатор инструментов, который проверяет вызовы по схемам. Некорректный запрос сразу получает структурированную ошибку, а для допустимого запроса замороженная LLM другой серии создаёт правдоподобный ответ. Это позволяет обучать агента без обращения к рабочим API, но делает качество схем и имитатора частью обучающей инфраструктуры.

Разделение вводит осознанное допущение: плотная награда за исполнение должна достаточно точно описывать удачный вызов инструмента. SLCA не отрицает, что действия влияют на финальный текст, но запрещает качеству формулировки напрямую менять токены, которые выбирают инструменты.

Когда результат стоит учитывать в планах

Метод проверяли на Qwen2.5-3B-Instruct, Qwen2.5-7B-Instruct и Qwen3-8B-Base. Оценка охватывала Toucan-Test для знакомого распределения задач, BFCL V3 для переноса на новые схемы и τ2-Bench для длительного взаимодействия с пользователем.

В основном контролируемом сравнении GRPO и SLCA-GRPO использовали одинаковые данные, начальную модель после обучения по примерам, имитатор, награды и вычислительный бюджет. На модели 7B строгий успех на Toucan-Test достиг 79,13%, что на 2,53 процентного пункта выше GRPO. На BFCL прирост составил 1,36 пункта, а на τ2-Bench — 9,15 пункта.

Сравнение с ToolPO и RLTR менее прямое: эти методы сохраняли собственные схемы наград и обучения. Поэтому главный аргумент работы — не лидерство одной строки в общей таблице, а контролируемая замена общего сигнала на два раздельных при прочих равных условиях.

Подход стоит закладывать в экспериментальный план, если агент одновременно вызывает инструменты и пишет пользовательское резюме, а команда уже может независимо проверить исполнение. Изменения затронут разметку сегментов, расчёт наград и функцию потерь, но не потребуют делить агент на несколько моделей.

Если система располагает только итоговой оценкой ответа, SLCA применять рано: методу нужен отдельный и достаточно надёжный сигнал для действий. Он также разделяет исполнение и формулировку, но не определяет, какой из нескольких последовательных вызовов внутри первого сегмента заслужил награду. Сочетание с методами временного распределения награды в работе не проверяли.

Источники

Иллюстрация: рисунок из статьи «SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL», Yan Zhan, Shaobo Liu, Qiunan Liu и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу