Журнал · Rit.work

Caddie учит советчика для LLM-агента по исходу задачи

Caddie обучает отдельного критика по финальному результату задачи, не размечая промежуточные шаги, и переносит его между базовыми моделями и агентными средами.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Caddie научили давать LLM-агенту полезный совет в середине многошаговой задачи. В нерецензированном препринте, где все числа получили сами авторы, критик Qwen3-4B поднял долю успеха на MuSiQue более чем на 25 процентных пунктов. Для продуктовой команды это вариант отдельного управляющего модуля: базовую модель можно не дообучать, а советчик переносить между агентами.

Как итог задачи превращают в сигнал для обучения

Критик получает цепочку действий агента и ответов среды до случайно выбранного промежуточного шага. Он анализирует текущее положение, указывает возможную ошибку и предлагает следующие действия обычным текстом.

Из одного состояния критик генерирует 16 вариантов совета. Замороженный агент продолжает задачу после каждого варианта, а финальный результат становится оценкой совета. В основных запусках для каждого текста выполняли одно продолжение, поэтому обучение сравнивало советы внутри группы, а не пыталось точно измерить пользу каждого из них отдельно.

Параметры обновляют только у критика с помощью DAPO — варианта обучения с подкреплением, который повышает вероятность советов с лучшим итогом относительно других текстов из той же группы. Размечать каждый шаг как правильный или ошибочный не нужно. Не нужны и эталонные критические замечания, написанные человеком или более крупной моделью.

Во время работы агент сам вызывает критика через отдельный инструмент и получает совет как ответ среды. В основных тестах разрешали до трёх обращений за задачу. Это избавляет от жёсткого расписания: помощь не приходит на каждом шаге, а запрашивается тогда, когда базовая модель считает её нужной.

Такой способ обучения требует ветвить выполнение из одного и того же состояния. Среда должна позволять восстановить его, запустить несколько продолжений и автоматически проверить конечный результат. Для внешних инструментов с необратимыми действиями или дорогими вызовами это заметное архитектурное условие, а не только вопрос обучения модели.

Один критик помогает разным базовым моделям

На MuSiQue с приложенными материалами успех Qwen3-4B вырос с 21,56% до 46,88%. На ALFWorld прибавка составила 25,93 процентного пункта. В обоих случаях обученный советчик оказался полезнее критиков того же класса, которым просто дали инструкцию анализировать действия агента.

Критика обучали на продолжениях Qwen3-4B, а затем без адаптации подключили к Qwen3-30B-A3B, Qwen3.8-27B и Kimi K3. На MuSiQue с приложенными материалами он улучшил все базовые модели; для Kimi K3 прибавка достигла 12,44 процентного пункта. При поиске в Wikipedia перенос оказался слабее: в одном сочетании прирост не достиг одного пункта.

Совет переносился и между типами задач. Критик, обученный на многошаговых вопросах MuSiQue, помогал в DeepDive с веб-поиском и в τ3, где агент ведёт диалог с клиентом и вызывает инструменты по правилам розничной торговли или авиакомпании. Вариант, обученный с поиском в Wikipedia, улучшил средний результат во всех проверенных сочетаниях задачи и базовой модели.

Перенос не означает, что критик выдаёт один универсальный шаблон. В разборе ответов он советовал небольшой модели продолжать поиск, когда та останавливалась без достаточных доказательств. Более крупной модели тот же критик чаще предлагал прекратить поиск и ответить по уже собранным данным.

Когда работа меняет план агентной системы

Результат поддерживает архитектуру с отдельным советчиком, если продукт уже состоит из многошагового агента, инструментов и проверяемого конечного исхода. Критика можно обучить с одной базовой моделью, оставить исполнитель неизменным и затем проверить тот же модуль с другими моделями. Это сокращает зависимость от пошаговой разметки и позволяет менять исполнитель без немедленного повторного обучения советчика.

Проверка охватывает двести вопросов MuSiQue, официальный набор из 134 игр ALFWorld и меньшие выборки DeepDive и τ3. Для MuSiQue и ALFWorld обучали отдельные критики, а перенос между предметными областями проверяли только у вариантов MuSiQue. Все обученные критики основаны на Qwen3-4B, поэтому работа не показывает, как размер самого советчика влияет на качество и перенос.

Caddie рассчитан на задачи, где после совета агент ещё должен взаимодействовать со средой. В короткой задаче без инструментов критик может научиться не направлять исполнителя, а сразу писать готовое решение, которое тот скопирует. Тогда модуль превращается во второго решателя и теряет предполагаемую независимость от модели и области.

Для внедрения нужен пилот на собственных траекториях: среда должна воспроизводить состояние, итог — проверяться автоматически, а цена дополнительных продолжений — укладываться в бюджет. Если эти условия выполняются, работа даёт практический путь к обучению агента на конечном бизнес-результате без отдельной разметки каждого решения по ходу процесса.

Источники

Иллюстрация: рисунок из статьи «Training Advisors for LLM Agents from Task Outcomes», Sergei Polezhaev, Barys Liskavets, Ori Press и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу