Журнал · Rit.work

EAPO уточняет вклад токенов без дополнительной модели

EAPO использует неопределённость самой LLM, чтобы закреплять редкие удачные ходы и исправлять уверенные ошибки при обучении с проверяемой наградой.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Редкий удачный ход модели стоит усиливать, а уверенную ошибку — наказывать сильнее. Работа KAIST и DeepAuto.ai, которая не прошла рецензирование и содержит замеры самих авторов, показала: такое распределение обучающего сигнала повысило среднюю точность до 6,52 процентного пункта относительно равномерного подхода. Для этого не нужны дополнительная модель, новые размеченные данные или отдельные генерации.

Почему одинаковая награда закрепляет не те решения

Обучение с проверяемой наградой оценивает ответ целиком: решена задача — модель получает положительный сигнал, не решена — отрицательный. В GRPO этот сигнал одинаково распределяется между всеми токенами ответа, хотя одни решения определили результат, а другие почти на него не повлияли.

Энтропия политики показывает, насколько модель не уверена в следующем токене. Высокая энтропия означает, что несколько продолжений имеют близкие вероятности; низкая — что модель почти выбрала один путь. Это готовый внутренний сигнал, который можно получить во время генерации ответа.

Но высокая энтропия сама по себе не говорит, правильный ли ход сделала модель. Если ответ оказался верным после неуверенного выбора, этот путь может быть трудно повторить. Если ответ неверен, неуверенная позиция всё ещё оставляет альтернативы, а сильный штраф способен преждевременно их закрыть.

Один пример из работы показывает эту разницу. В математической задаче 28 из 32 попыток пошли через неравенство AM–GM и завершились ошибкой из-за одной неверной подстановки. Редко выбранный метод множителей Лагранжа дал единственный правильный ответ: равномерная награда закрепила бы весь текст, а не момент, где модель нашла менее вероятный рабочий путь.

Как EAPO распределяет сигнал между токенами

EAPO начинает с того же относительного выигрыша ответа, который рассчитывает GRPO. Затем метод перераспределяет его между токенами по энтропии, не меняя знак и среднюю силу сигнала для ответа целиком.

  1. Во время генерации модель сохраняет распределение вероятностей следующего токена и вычисляет его энтропию.

  2. Значения нормализуются внутри обучающей партии, а крайние значения обрезаются. Это уменьшает влияние отдельных всплесков неопределённости.

  3. В удачном ответе больший положительный вес получают токены с высокой энтропией. Так редкий успешный выбор превращается в более устойчивое поведение.

  4. В неудачном ответе больший штраф получают токены с низкой энтропией. Неуверенные позиции штрафуются слабее, чтобы модель могла исследовать другие продолжения.

Энтропия при этом не становится оценкой правильности конкретного токена. Она лишь указывает, где модель выбирала между конкурирующими вариантами, а знак общей награды определяет, нужно ли усиливать или ослаблять выбранный путь.

EAPO заменяет равномерный сигнал GRPO на токенные веса внутри прежней функции обучения. Метод не требует модели, которая отдельно оценивает ход рассуждения, доступа к эталонной цепочке или повторного запуска ответов ради оценки каждого шага.

Когда результат меняет планы обучения

Главное сравнение охватывает шесть математических наборов задач и четыре основы: Qwen3-4B-Base, Qwen3-8B-Base, Qwen3-4B и Olmo-3-7B-Think-DPO. EAPO показал лучший общий результат среди GRPO и методов, которые тоже направляют обучение по неопределённости, хотя преимущество различалось между моделями и задачами.

В проверке отдельных компонентов переход от равномерного распределения к полной схеме EAPO прибавил 6,52 процентного пункта к avg@32 — средней точности при 32 генерациях на задачу. Если оставить усиление неуверенных успешных ходов, но перенести штраф с неуверенных ошибок на уверенные, точность выросла ещё на 5,64 процентного пункта. Значит, результат связан не только с использованием энтропии, но и с разным отношением к успеху и неудаче.

Работа касается команд, которые сами дообучают рассуждающие модели через RLVR. Если конвейер уже хранит вероятности токенов и рассчитывает преимущество ответа, EAPO меняет распределение сигнала, а не архитектуру модели или проверяющий модуль. Для продуктов, которые вызывают готовую LLM через API и не управляют её обучением, метод планов не меняет.

Основные сопоставимые эксперименты проведены на математических задачах, а разбор механизма опирается прежде всего на базовые модели Qwen3. Надёжность подхода зависит от того, насколько внутренняя неопределённость конкретной модели совпадает с действительно важными развилками рассуждения. Отдельного замера времени и памяти работа не приводит, поэтому стоимость внедрения придётся проверить в собственном обучающем контуре.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу