Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Многошагового LLM-агента научили отдельно определять, какой ответ и какой токен помог завершить задачу. VETTA повысила долю успешных заданий относительно обычного PPO на 37,5 процентного пункта в ALFWorld и на 22,3 пункта в WebShop, но препринт не рецензирован, а числа получили сами авторы. Подход позволяет улучшать обучение не только увеличением модели или числа попыток, но и более точной оценкой вклада решений.
Как VETTA делит вклад между ходом и токеном
Многошаговый агент получает инструкцию, отвечает, видит результат действия и продолжает работу. Награда часто приходит только после нескольких таких ходов, поэтому алгоритму трудно понять, какое действие приблизило успех, а какое оказалось лишним.
PPO — алгоритм обучения с подкреплением, который обновляет модель по оценке пользы каждого решения. В многошаговом агенте эту пользу можно считать на двух уровнях. Первый оценивает законченный ответ как действие в среде, второй — решения при генерации отдельных токенов внутри ответа.
Оценка только по ходам различает удачные и неудачные действия, но одинаково обновляет все токены одного ответа. Оценка по токенам находит полезные фрагменты, однако ей сложнее переносить редкую награду через длинную последовательность ответов и наблюдений.
VETTA обучает обе оценки одновременно. Общий критик обрабатывает контекст и ответ, а две отдельные головки предсказывают ожидаемый результат: одна перед генерацией всего ответа, другая перед каждым токеном. Критиком здесь называют модель, которая не выбирает действие, а оценивает его ожидаемую пользу для обучения основной модели.
Затем VETTA вычисляет преимущество — насколько решение оказалось лучше или хуже ожидаемого. Преимущество хода задаёт общий вес ответа. Токенные преимущества центрируются внутри этого ответа: из каждого значения вычитается среднее, поэтому токены перераспределяют вклад между собой, но не меняют общую оценку хода.
Это разделение защищает обновление от двойного учёта. Целый ответ определяет, стоит ли закреплять действие, а токенный остаток показывает, какие решения внутри него следует усиливать или ослаблять.
Совместная оценка улучшила точное завершение задач
Проверка охватывает ALFWorld с текстовыми бытовыми заданиями и WebShop с поиском товаров на имитируемом сайте. VETTA обучали на двух размерах Qwen2.5-Instruct и сравнивали с подсказочными подходами, методами без критика, обычным PPO и вариантом, который оценивает только завершённые ответы.
С Qwen2.5-7B-Instruct агент успешно завершил 95,5% заданий ALFWorld и 76,0% заданий WebShop. На обоих размерах модели VETTA показала лучшую общую долю успеха среди выбранных методов сравнения.
Результат относится именно к точному завершению задания. В WebShop отдельные варианты давали высокий промежуточный балл за частично подходящий товар, но реже выполняли все условия покупки. Совместная оценка хода и токенов лучше переводила частичный прогресс в результат, который среда засчитывала как успех.
Эксперименты охватывают две текстовые имитации со структурированными действиями и редкой наградой. Перенос результата на браузеры, корпоративные приложения и более длинные процессы потребует отдельной проверки в целевой среде.
Что меняется в планах команд
VETTA имеет практический смысл для команд, которые обучают веса многошагового агента, собирают его траектории и могут вычислить награду за результат. Для систем, где готовая модель вызывается только через API и управляется подсказками, метод напрямую не применяется: он меняет процесс обучения, а не оркестрацию запросов.
Полноразмерный критик для этого не потребовался. Сокращение его основы с 28 блоков Transformer до 2 уменьшило медианное время на оценку и обновление критика на 87% в ALFWorld и на 91% в WebShop. При этом короткий критик показал более высокую среднюю долю успеха, чем полный.
Это меняет порядок технических экспериментов. Перед увеличением основной модели или бюджета на генерацию стоит проверить две отдельные головки оценки, центрированный токенный остаток и короткий критик из ранних блоков исходной модели. Каждый компонент можно добавить к существующему контуру PPO и проверить отдельно.
Выбирать минимальную глубину критика как универсальную настройку пока рано: глубину сравнивали на одной семье моделей и двух средах. Но работа показывает, что критик не обязан повторять размер основной модели, а точность распределения вклада может влиять на результат сильнее, чем его вычислительная сложность.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



