Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Shubham Gandhi, Saurabh Goyal, Kiran Kate и Yara Rizk из Carnegie Mellon University и IBM Research представили DRACO — способ обучать агентов с длинными последовательностями действий без сигнала об успешном результате. На AppWorldTN метод прибавил 15,9 процентного пункта к базовой модели; результат описан в препринте, который не проходил рецензирования. Работа важна командам, которые обучают агентов для поддержки, исследований и работы с API, где результат нельзя автоматически проверить одним тестом.
Что сделали
Обычное обучение с подкреплением хорошо работает, когда результат проверяет программа: тесты подтверждают исправность кода, а состояние среды — выполнение операции. Для открытых задач такого проверяющего механизма может не быть. Тогда траекторию оценивают по текстовой рубрике, но итоговая оценка назначается всей последовательности действий сразу и одинаково влияет как на полезные, так и на ошибочные шаги.
DRACO разделяет формирование оценки и её распределение. Процесс выглядит так:
- Создание критериев. Замороженная модель-оценщик сначала составляет рубрику из инструкции, затем дополняет её по каждой сгенерированной траектории. Так в критерии попадают не только ожидаемые подзадачи, но и фактические способы успеха или ошибки текущей модели.
- Объединение. Критерии для одной группы траекторий сводятся в общий список, дубликаты удаляются. Критерий отбрасывается, если его выполнили все варианты: такой пункт не помогает различать их качество.
- Оценка траектории. Для каждого оставшегося критерия модель-оценщик возвращает вердикт «выполнен», «не выполнен» или «не применим». Она также указывает шаги, на которых основан вердикт. Итоговое вознаграждение рассчитывается как баланс выполненных и проваленных применимых критериев.
- Сравнение внутри группы. GRPO — групповая относительная оптимизация политики — сопоставляет вознаграждения нескольких решений одной задачи. Траектории выше среднего получают положительный сигнал преимущества, ниже среднего — отрицательный.
- Распределение по шагам. В успешной траектории усиление концентрируется на шагах, связанных с выполненными критериями. В неуспешной подавление направляется на шаги, связанные с ошибками. Поправка на длину не позволяет многословному шагу получить больше влияния только из-за числа токенов.
Суммарное влияние траектории при этом не меняется: DRACO перераспределяет уже рассчитанный сигнал, а не добавляет новое вознаграждение. Отдельный обучаемый модуль для поиска ответственных шагов не требуется. Однако программный верификатор заменяется внешней моделью-оценщиком, а не устраняется сама потребность в оценке.
Что показали
Авторы обучали агентов на AppWorld, где нужно обращаться к приложениям через API и поддерживать состояние многошагового процесса. Истинный результат задачи использовался при тестировании, но не входил в обучающее вознаграждение.
На обычном тестовом разделе AppWorld доля выполненных проверок при одной попытке составила 85,3% против 69,4% у базовой модели. Вариант GRPO с вознаграждением от программных тестов получил 80,0%. На τ-bench Banking, который не использовался для обучения, DRACO показал 20,4% успешных попыток против 15,8% у базовой модели.
Разбор компонентов также поддерживает основную гипотезу авторов: полная схема оказалась лучше вариантов без динамических рубрик или без распределения сигнала по шагам. Это указывает, что адаптация критериев и назначение ответственности решают разные части задачи, хотя эксперимент не доказывает правильность каждой отдельной атрибуции.
Ограничения
Обучение проводилось на 90 задачах AppWorld. Проверка охватывала два раздела AppWorld на 168 и 417 задач, а также 97 задач τ-bench Banking. Это симулированные среды с инструментами; работа не показывает, сохранится ли эффект в производственных процессах с неоднозначными правилами, меняющимися API и последствиями реальных операций.
Основные эксперименты зависят от одной замороженной модели-оценщика. Авторы не сопоставляли её критерии с человеческими оценками, поэтому внутренняя последовательность вердиктов не гарантирует, что рубрика описывает нужный результат. Они также измеряли качество по итоговому выполнению задач, а не проверяли напрямую, действительно ли вознаграждение попало на ответственные шаги.
В сравнении не хватает человеческой проверки критериев и прямой оценки атрибуции. Кроме того, авторы не измерили вариативность самого обучения при изменении состава траекторий, хотя от него зависит, какие критерии переживают фильтрацию.
Что это значит
Для большинства продуктовых команд работа не меняет выбор базовой модели или архитектуру агента. Она меняет план собственного дообучения, если команда уже собирает траектории выполнения задач, но не может написать надёжный автоматический тест результата.
DRACO предлагает практическое направление: описывать качество через изменяемые критерии процесса, сохранять ссылки критериев на конкретные действия и использовать их при обновлении политики. Это применимо там, где проверка всего результата дорога или неоднозначна, но отдельные признаки корректного процесса всё же можно сформулировать.
Закладывать метод как готовую замену верификатору рано. Внешняя модель-оценщик становится частью обучающей инфраструктуры и определяет цель оптимизации, поэтому команде всё равно нужны аудит критериев, ручная проверка спорных траекторий и отдельные тесты безопасности. Работа оправдывает прототип и сравнительный эксперимент на собственных данных, но не отказ от проверяемых ограничений там, где их можно построить.
Источники
Иллюстрация: рисунок из статьи «DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training», Shubham Gandhi, Saurabh Goyal, Kiran Kate и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



