Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
В обучении ИИ-агентов научились отдельно поощрять решения, которые повысили шанс выполнить задачу, а не всю успешную цепочку действий целиком. В нерецензированном препринте команда Microsoft и трёх университетов приводит собственные замеры: ProVer улучшил средний результат относительно GRPO на 9,91% для Qwen3.5-2B и на 7,12% для Qwen3.5-4B. Подход позволяет точнее обучать длинные последовательности действий, не проверяя каждый промежуточный шаг.
Почему итоговая награда плохо объясняет успех
Групповая относительная оптимизация политики (GRPO) запускает несколько траекторий для одной задачи и сравнивает их конечные результаты. Если агент справился, все созданные им токены получают положительный сигнал; если не справился — отрицательный.
Для короткого ответа такого различия часто достаточно. В длинной работе с сайтом, поиском или внешним инструментом успешная траектория может содержать лишние и ошибочные действия, а неудачная — несколько полезных решений перед финальной ошибкой. GRPO не различает их и одинаково оценивает весь путь.
Можно оценивать каждый промежуточный шаг отдельной моделью, но тогда её суждение напрямую управляет обучением. Такая модель может ошибаться, устаревать по мере изменения обучаемой политики или давать оценки, которыми оптимизация научится манипулировать. Проверять каждый шаг новыми прогонами надёжнее, но для длинных траекторий это требует многократно восстанавливать среду и заново выполнять задачу.
Как ProVer выбирает и проверяет ключевой отрезок
ProVer разделяет поиск важного решения и расчёт его пользы. Внешняя модель-оценщик получает полную успешную траекторию и сокращённые представления неудачных попыток из той же группы. Она ищет повторяющиеся причины провала, запрашивает нужные фрагменты и указывает короткий непрерывный отрезок успешной траектории, который мог изменить исход.
Это указание остаётся гипотезой. Числовую оценку модель-оценщик не выставляет: ProVer восстанавливает состояние агента и среды перед выбранным отрезком и сразу после него, а затем из обеих точек запускает свежие продолжения с текущей политикой.
Доля успешных продолжений показывает вероятность выполнить задачу из каждого состояния. Если после выбранных действий вероятность выше, разница становится дополнительным положительным сигналом для токенов внутри отрезка. При нулевой или отрицательной разнице ProVer не добавляет бонус; остальные токены и траектории сохраняют обычные оценки GRPO.
Расчёт опирается на проверяемый конечный исход, а модель-оценщик лишь направляет вычислительный бюджет. Метод предполагает, что среду можно восстановить на границах отрезка, его записанные действия воспроизводятся однозначно, а задача выдаёт двоичную итоговую награду без промежуточных наград. Свежие продолжения нужны только для оценки и не входят в пакет данных, на котором обновляют политику.
Когда подход меняет план обучения агента
ProVer проверяли на ALFWorld, где агент управляет предметами в текстовом симуляторе дома, на имитаторе интернет-магазина WebShop и в поисковой среде SearchQA. Политиками служили две модели Qwen3.5, а среди вариантов сравнения были стандартный GRPO, методы с ветвлением траекторий и CriticSearch, который напрямую превращает суждения внешней модели в локальные оценки. Поэтому выводы относятся прежде всего к небольшим моделям, проверяемым конечным результатам и средам, состояние которых можно сохранять.
Дополнительная генерация относительно GRPO составила 2,4% на ALFWorld, 11,6% на WebShop и 16,8% на SearchQA. Это не бесплатное улучшение: команде понадобятся снимки состояния среды, параллельные продолжения и внешний либо локальный оценщик. Однако ProVer расходует этот бюджет на границах одного выбранного отрезка, а не вдоль всей траектории.
Осмысленный выбор тоже влияет на результат. На SearchQA оценщики находили отрезки с положительной проверкой как минимум втрое чаще случайного выбора, хотя предлагали более короткие фрагменты. Передовая модель для этого не обязательна: локальная Qwen3.5-9B и компактные модели семейства GPT-5.4 тоже находили полезные участки, а средняя стоимость обращений к оценщику оказалась на 38,4% ниже, чем у CriticSearch.
Командам, которые уже обучают агента через GRPO и могут надёжно восстановить среду, имеет смысл добавить выборочную проверку ключевых действий до перехода к более сложной модели награды. Для продуктов, где модель доступна только через API, нет собственного цикла обучения или итог нельзя проверить автоматически, ProVer архитектурный план не меняет.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



