Журнал · Rit.work

FlowBalance обучает reasoning-модель на собственных решениях с проверкой результата

FlowBalance объединяет автоматическую проверку ответа и самооценку модели, чтобы обучать распределение полных решений без отдельной имитации на уровне токенов.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Zixun Huang, Kishan Panaganti, Haitao Mi и Leowei Liang предложили FlowBalance — метод дообучения reasoning-модели на решениях, сгенерированных её текущей политикой; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, метод превзошёл FlowRL на обеих проверенных версиях Qwen3. Это важно командам, которые обучают собственные модели рассуждать на задачах с автоматически проверяемым ответом.

Что сделали

Модель генерирует несколько решений одной задачи, после чего верификатор — автоматический проверяющий механизм — оценивает правильность финальных ответов. Замороженная копия той же модели повторно оценивает токены, но получает доступ к учебному контексту, например эталонному решению. Этот контекст используется только при обучении.

FlowBalance объединяет оба сигнала на уровне полной траектории рассуждения. Если ответ лучше остальных в группе, самооценка усиливает его; если хуже — направление самооценки меняется на противоположное; если проверка не выявляет предпочтения, этот сигнал отключается. Затем баланс траекторий (trajectory balance) подбирает нормализованное распределение вероятностей полных ответов относительно исходной политики. Отдельной функции имитационного обучения на уровне токенов нет.

На среднем результате по AIME24, HMMT25, MATH500 и OlympiadBench авторы измерили преимущество над FlowRL в 1,67 процентного пункта для Qwen3-4B и 1,98 пункта для Qwen3-8B. В работе также утверждается, что обучение было стабильнее, чем у GRPO, а деградации к коротким ответам, наблюдавшейся у прямого OPSD, не произошло.

Что это значит

FlowBalance предлагает разделить роли сигналов: проверяемый результат задаёт направление обновления, а самооценка уточняет распределение между решениями. Такой подход применим, когда команда может автоматически проверить итог и предоставить модели дополнительный учебный контекст. Практически это альтернатива добавлению ещё одной локальной функции потерь: политика обучается сразу на распределении полных решений.

Ограничения. Авторы проверяли метод только на математических задачах, фиксированном распределении запросов и двух размерах Qwen3, поэтому работа не показывает перенос на агентные, мультимодальные и другие длинные процессы. Анализ разнообразия проведён для AIME24 в одной точке обучения и с моделью-оценщиком, а не в многократной человеческой проверке. Сравнение скорости дано в шагах обучения, поэтому из него нельзя определить вычислительную стоимость относительно альтернатив.

Источники

Иллюстрация: рисунок из статьи «FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience», Zixun Huang, Kishan Panaganti, Haitao Mi и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу