Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Ветвление при обучении моделей с подкреплением можно направлять не в самые неоднозначные места, а туда, где следующий прогон сильнее уточнит обновление модели. Nikita Khomich, Leopold Hermansson и Ido Hakimi получили в многоходовом Wordle долю побед 0,850 против 0,790 у плоского GRPO, хотя препринт не рецензирован и все числа получили сами авторы. Для долгих и многоходовых задач это превращает дерево прогонов из способа увеличить выборку в инструмент распределения вычислительного бюджета.
Почему энтропия выбирает не те развилки
GRPO берёт несколько ответов на один запрос, сравнивает их итоговые награды и назначает каждому действию внутри ответа одно общее преимущество. Если модель сначала ошиблась, а затем исправилась, алгоритм не разделит ошибку и восстановление: оба шага получат сигнал от одного конечного результата.
Дерево позволяет повторно использовать общий префикс, пробовать после него разные действия и отдельно оценивать их продолжения. Так модель получает локальный сигнал без отдельной модели, которая выставляет награду промежуточным шагам.
Обычно место для ветвления выбирают по энтропии: она показывает, насколько равномерно модель распределяет вероятность между возможными действиями. Но высокая энтропия не означает, что выбор влияет на награду. Несколько равнозначных формулировок создадут много ветвей, но почти не помогут оценить градиент — направление, в котором алгоритм меняет параметры модели.
EPIG-Tree разделяет два источника ошибки. Неопределённость решения возникает, когда возможные действия дают разные по значению обновления; её снижают новые ветви. Неопределённость продолжения возникает, когда одно действие приводит к разным результатам из-за случайности среды; её снижают повторные прогоны из уже выбранной ветви.
Метод оценивает, насколько каждая дополнительная ветвь уменьшит ошибку градиента с учётом своей вычислительной цены. Больше прогонов получают состояния, которые чаще встречаются при обучении, сильнее влияют на параметры и дают более шумные продолжения. Дорогие продолжения, напротив, получают меньшую долю бюджета.
EPIG-Tree всё ещё использует энтропию, но только чтобы найти возможные точки ветвления. Затем пробные прогоны показывают, различаются ли ветви по награде и влиянию на градиент. Алгоритм пересчитывает оценки после добавления ветвей, строит локальные преимущества и применяет их только к тем токенам или действиям, которые вызвали развилку.
Где точное ветвление улучшило обучение
В клонируемых средах управления политику замораживали, сохраняли состояние и сравнивали бюджетную оценку градиента с эталоном, полученным при большем числе продолжений. EPIG точнее энтропии и равномерного распределения восстановил градиент в девяти из тринадцати сред — во всех задачах с плотной наградой и достаточно большим выбором действий.
Следующая проверка использовала Qwen3-8B на GSM8K. Среди древовидных методов EPIG стабильнее совпадал с эталонным направлением, чем ветвление по энтропии. Плоский GRPO при этом лучше совпал с эталоном, построенным в его собственной логике: результат показывает, что способ назначить локальные преимущества и выбрать обучаемые токены влияет не меньше топологии дерева.
В однопроходных математических задачах локальные сигналы дерева улучшили результат относительно плоского GRPO, но разные способы выбирать ветви остались в пределах шума одиночных запусков. Здесь работа не даёт основания считать EPIG лучше более простой эвристики по энтропии.
В многоходовом Wordle различие проявилось во время полноценного обучения. Плоский GRPO быстрее набрал результат, но рано перестал улучшаться. Древовидные методы продолжили обучение, а EPIG завершил его выше ветвления по энтропии и равномерного дерева.
Граница метода совпала с его устройством. При малом числе действий равномерная выборка и так покрывает существенные варианты. При редкой или скачкообразной награде пробные прогоны плохо различают перспективные ветви, поэтому EPIG теряет преимущество и не заменяет отдельный механизм исследования среды.
Когда EPIG-Tree меняет план разработки
Работа даёт практический повод пересмотреть обучение агентов, если среда хранит состояние, допускает повторный запуск из одной точки и содержит исправления после ошибок. Это относится к многоходовым играм, работе с инструментами и другим процессам, где одинаковое действие может получить разный итог из-за последующих решений или случайности среды.
Внедрение потребует сохранять префиксы или состояния, стоимость продолжений, вероятности действий и награды. Затем система должна отдельно распределять бюджет между новыми действиями и повторными продолжениями. Сам показатель EPIG вычисляется по уже собранным прогонам, но пробные ветви и пересчёт локальных преимуществ усложняют весь контур данных.
Особенно важна маска токенов, к которым применяют преимущество ветви. Ошибка в ней обучала только короткий фрагмент и пропускала токены ответа; после исправления Pass@1 — доля задач, решённых с первой попытки, — выросла с 0,547 до 0,781. Точный выбор ветви не помогает, если её награда меняет параметры по неправильным токенам.
Поэтому EPIG-Tree пока не выглядит основанием заменить работающий GRPO во всех задачах. Он оправдывает отдельный эксперимент там, где полные независимые прогоны дороги, дерево уже строится, а пробные продолжения способны показать разницу между действиями. Для коротких ответов, маленького пространства действий и редкой награды сначала полезнее проверить локальное назначение награды и маску обучения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



