Журнал · Rit.work

SERA учит рекурсивного агента оценивать собственные подзадачи

SERA обучает рекурсивного агента составлять критерии для собственных подзадач и использовать их вместо постоянных обращений к внешней модели-оценщику.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языкового агента научили самому оценивать выполненные подзадачи и выбирать лучшие ветви решения. В препринте, который не проходил рецензирование и содержит замеры самих авторов, метод SERA улучшил результат базовых рекурсивных агентов на 5,38 пункта в TextCraft-Synth и на 13,14 пункта в TextWorld-Sync. Внешняя модель-оценщик теперь нужна для обучения критериев, а не для проверки каждого узла во время обычной работы.

Рекурсивный агент разбивает исходную задачу на подзадачи и поручает их новым экземплярам той же модели. Перед таким поручением родительский агент составляет короткую рубрику: перечисляет критерии успеха и назначает им веса. Рубрика фиксируется до начала работы дочернего агента, поэтому её нельзя подогнать под уже полученный ответ.

После выполнения подзадачи та же модель применяет рубрику к результату и выдаёт оценку. Чтобы научить её составлять подходящие критерии, SERA сравнивает несколько вариантов решения одной подзадачи с результатами внешней проверки и поощряет рубрики, которые ставят успешные варианты выше неудачных. Отдельный сигнал награждает полезное разбиение: больше оценки получает ветвь, которая охватывает существенную долю работы в успешно завершённом дереве.

Обученная рубрика пригодилась и при поиске по дереву. SERA создавал по два варианта в точках выбора, оценивал их снизу вверх и сохранял лучший. На TextWorld-Sync такой отбор поднял среднюю долю успешных решений ещё на 2,43 пункта. Собственная оценка модели дала 67,50% успеха против 67,29% у внешней Kimi-K3, то есть в этом опыте практически не уступила ей.

Метод проверяли на Qwen3-4B-Instruct и двух синтетических средах с автоматически проверяемым итогом. Они требуют координировать зависимые подзадачи, но не показывают, как рубрики поведут себя на крупных моделях и реальной разработке или поиске информации. Кроме того, обучение всё ещё опирается на проверенные исходы, а награда за разбиение считает все конечные подзадачи одинаково важными.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу