Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Сигнал модели-учителя научились добавлять к проверке финального ответа так, чтобы он влиял на выбор лучшего решения и распределял обучающий вес между токенами, но не менял его сумму для ответа. В нерецензированном препринте, где все числа получили сами авторы, UECR-GRPO обошёл сильнейшие сравниваемые методы в среднем на 0,89 и 0,56 процентного пункта для двух размеров Qwen3. Для команд, которые уже обучают модели с проверяемой наградой и отдельным учителем, это кандидат на эксперимент, но не основание сразу менять рабочую схему.
Почему учителю нельзя отдать выбор правильного решения
При обучении с подкреплением по проверяемой награде (RLVR) внешний проверяющий оценивает конечный ответ. GRPO сравнивает несколько решений одной задачи, вычисляет для каждого общий обучающий сигнал и назначает его всем токенам ответа.
Такая схема знает, получилось ли решение, но не знает, какой шаг помог или сломал рассуждение. Если все ответы в группе получили одинаковую бинарную награду, GRPO также не может различить их: после нормализации обучающий сигнал исчезает.
Модель-учитель решает другую часть задачи. Она оценивает каждый следующий токен в тех последовательностях, которые сгенерировал ученик, поэтому может различать ответы с одинаковой финальной наградой. В замерах по контрольным точкам учитель различал от 84,3 до 98,4% таких групп.
Но его предпочтение не равно математической правильности. Порядок, заданный учителем, расходился с результатом проверяющего для 39,1–50,8% пар из правильного и неправильного ответов. Учитель может предпочесть знакомый стиль ошибочного решения или занизить вероятность непривычного, но верного хода.
Команда Shanghai Jiao Tong University и Zhejiang University поэтому оставила проверяющему роль источника целевой награды, а учителю — роль дополнительного сигнала. Он помогает различать траектории и находить важные места внутри ответа, но не заменяет проверку результата.
Как сохраняют общий вес ответа
UECR-GRPO разделён на два последовательных этапа. Первый, PUU, объединяет финальную награду и оценку учителя до групповой нормализации. Оценка учителя строится как средняя разница между логарифмами вероятностей токенов у учителя и у старой версии ученика, которая сгенерировала ответы.
Среднее, а не сумма, нужно для контроля длины: длинный ответ иначе механически получил бы более крупный сигнал. После объединения GRPO сравнивает уже совместную полезность ответов. Поэтому учитель может развести решения с одинаковой наградой и повлиять на их порядок, чего не делают схемы, добавляющие его оценки после нормализации.
Второй этап, ECR, распределяет часть сигнала от проверяющего между токенами. Если учитель считает токен более вероятным, чем старая версия ученика, его вес в успешном ответе растёт. В неуспешном ответе такой токен получает менее отрицательный сигнал, но не превращается в безусловный образец для копирования.
Силе этой поправки мешает неопределённость учителя. Метод вычисляет энтропию его распределения по всему словарю: чем равномернее вероятности следующих токенов, тем слабее локальная подсказка. Это защищает обучение от крупных расхождений именно там, где учитель сам не уверен в продолжении.
Затем ECR вычитает среднюю поправку внутри ответа. Одни токены получают больший вес, другие меньший, но их общая сумма остаётся прежней. До ограничения шага обновления положительный сигнал также не становится отрицательным и наоборот. Таким образом, учитель решает, где разместить награду, но не может незаметно увеличить её общий масштаб.
Меняет ли работа планы обучения моделей
Средняя точность по двенадцати генерациям составила 17,21% для Qwen3-1.7B и 65,09% для Qwen3-4B. UECR-GRPO показал лучший средний результат на обоих масштабах, однако уступал отдельным базовым методам на части тестов. Выигрыш относится к среднему по набору, а не к каждой математической задаче или каждому бенчмарку.
Метод проверяли на математических рассуждениях в Qwen3 без режима пошагового обдумывания. Учениками служили модели двух размеров, учителями — более крупные замороженные Qwen3, обучение шло на задачах DeepMath-103K. Итоговую точность измеряли на пяти конкурсных наборах AIME, AMC и HMMT; среди сравнений были Vanilla GRPO, дистилляция на ответах ученика, Distilled RL и адаптация ATOD.
Результаты разных масштабов нельзя напрямую считать эффектом размера: для них различались ученики, учителя, подмножества данных и число шагов обучения. Работа показывает устойчивый средний выигрыш внутри каждого набора условий, но не проверяет перенос метода на код, диалоги или продуктовые задачи.
Практический порог для внедрения высокий. UECR-GRPO требует вероятностей учителя для каждого сгенерированного токена и распределения по всему словарю, чтобы оценить неопределённость. Сервис, который возвращает только текст или одну итоговую оценку, не предоставляет достаточного сигнала для ECR.
Командам с собственным контуром обучения, проверяющим ответы и локально доступной моделью-учителем имеет смысл добавить UECR-GRPO как отдельную ветку эксперимента. Сначала стоит сравнить совместную нормализацию без перераспределения токенов, затем включить ECR: так станет видно, даёт ли выигрыш новый порядок ответов или более точное назначение веса внутри них. При небольшом среднем отрыве от базовых методов заменять существующий процесс до такого сравнения рано.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



