Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Языкового агента научили менять приоритеты обучения по мере того, как прежние слабые места перестают мешать результату. Хотя препринт не рецензирован и числа получили сами авторы, RewardWeaver поднял общую оценку на сложной части SOTOPIA с 3,94 до 4,38 по сравнению с сильнейшим предыдущим методом. Для команд это образец архитектуры, в которой награда становится отдельной управляемой системой, а не фиксированной формулой на весь цикл обучения.
Как находят слабое место, которое действительно мешает цели
В длинном диалоге итоговая оценка показывает, что агент провалил задачу, но не объясняет причину. Низкий балл мог возникнуть из-за ранней уступки, пропущенного факта, неудачной смены стратегии или действий собеседника. Если награждать все желательные качества сразу, полезный сигнал смешивается с критериями, которые текущую политику уже не ограничивают.
RewardWeaver добавляет внешний цикл вокруг обычного обучения с подкреплением. После этапа обучения агент снова проходит задачи, а система отбирает траектории с низким итоговым результатом и разбирает их от конца к началу. Для каждого предполагаемого дефицита она требует фрагмент диалога, который подтверждает связь между поведением агента и провалом.
В следующий этап попадают только повторяющиеся ошибки, которыми агент мог управлять сам. Единичные сбои, неподтверждённые объяснения и проблемы со стороны партнёра отбрасываются. Так система отличает часто встречающийся недостаток от текущего узкого места: первый легко заметить, но второй определяет, улучшится ли итог задачи.
На SOTOPIA библиотека содержала 40 проверенных способностей, но одновременно RewardWeaver включал в награду не больше шести. Состав пересматривался через 30 шагов оптимизации. Активные критерии получали одинаковый вес, поэтому метод выбирал, чему сейчас давать обучающий сигнал, а не подстраивал множество коэффициентов.
Почему критерии не переписываются вместе с моделью
Авторы разделили смысл награды и её актуальность. Каждая способность получает фиксированное определение и отдельную модель-оценщик. Перед включением в библиотеку критерий проверяют на примерах, которые не использовали при его разработке: он должен описывать наблюдаемое поведение, относиться к действиям агента и не дублировать уже принятую способность.
Быстрый цикл меняет только активный набор. Когда агент научился использовать ключевую информацию, этот критерий можно убрать и освободить место для смены стратегии или условных уступок. Само определение способности и способ её оценки остаются прежними, поэтому рост балла нельзя получить простым смещением смысла критерия.
Для новых типов ошибок действует более медленный путь. Если повторяющийся провал не укладывается в библиотеку, система предлагает новую способность, проверяет её и лишь затем допускает к будущим этапам. Новый критерий не влияет на то обновление награды, которое запустило его поиск. Это предохраняет обучение от ситуации, когда диагноз ошибки и правило оценки меняются одновременно.
Когда схема меняет планы разработки агента
RewardWeaver проверяли на SOTOPIA с 90 социальными сценариями, AmazonHistoryPrice с 930 товарами и собственном Sales Benchmark с 400 заданиями. Эти наборы охватывают социальные диалоги, торг при несимметричной информации и продажи услуг. В основе обучаемой политики использовали Qwen2.5-7B-Instruct, а среди партнёров и покупателей — другие фиксированные модели.
На AmazonHistoryPrice агент заключил сделку в 95,2% случаев, где соглашение было возможно, и получил нормализованную полезность продавца 0,9737 — лучший результат среди проверенных методов. В разборе компонентов динамический выбор критериев превосходил постоянный набор, а случайная смена активных критериев уступала выбору по диагностированным провалам. Значит, эффект связан не только с обновлением награды, но и с тем, куда направляют обучающий сигнал.
Работа меняет план, если продуктовый агент ведёт многошаговые переговоры или диалоги и получает содержательную итоговую оценку. В архитектуре стоит отделить стабильную цель продукта, библиотеку проверенных промежуточных критериев и внешний цикл, который решает, какие способности тренировать дальше. Это позволяет обновлять приоритеты без постоянного переписывания всей функции награды.
Схема требует надёжного итогового сигнала и моделей-оценщиков: ошибка в любом из них попадёт в выбор следующего узкого места. Параметры переноса награды между этапами также придётся настраивать под предметную область. Эксперименты показывают результат на трёх диалоговых средах, поэтому работу разумнее воспринимать как проверенный проектный шаблон для интерактивных агентов, а не как универсальную настройку обучения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



