Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Разнородные оценки ответа можно свести в один сигнал для обучения LLM, не приравнивая баллы за фактическую точность, формат и соблюдение инструкций. В препринте ERNIE Team из Baidu, который не проходил рецензирование и где все числа получили сами авторы, RLVR² обошёл методы, основанные на нормализации и суммировании критериев. Команды могут заменить только сборку награды, сохранив рубрики, проверяющие модули и алгоритм обучения.
Почему сумма критериев меняет цель обучения
Обучение с подкреплением по проверяемой награде хорошо работает, когда правильность можно определить одним правилом. Для математики это совпадение ответа, для кода — прохождение тестов. Открытый ответ приходится одновременно проверять на фактическую точность, выполнение инструкции, язык, безопасность и другие свойства.
Каждый критерий использует собственную шкалу. Соблюдение ограничения может принимать значения «да» и «нет», полнота ответа — несколько уровней, а автоматическая метрика — непрерывный балл. Алгоритм обучения при этом принимает для каждого варианта ответа одно число.
Обычная схема приводит оценки к общему диапазону, умножает их на веса и складывает. Она предполагает, что одинаковая разница на двух шкалах означает сопоставимое улучшение. Но переход от нарушения инструкции к её выполнению нельзя автоматически приравнять к небольшому росту полноты только потому, что после нормализации обе разницы выглядят одинаково.
Сумма также позволяет одному критерию компенсировать другой. Ответ может нарушить главное требование, но получить высокую награду за структуру, длину или оформление. Тогда модель учится воспроизводить признаки, которые нравятся проверяющему модулю, хотя содержание не становится лучше.
Как порядок ответов становится одной наградой
RLVR² рассматривает оценки только внутри группы ответов на один запрос. Для каждого критерия метод сравнивает ответы попарно и фиксирует победу, поражение или ничью. Исходная величина разрыва отбрасывается: важно, какой ответ лучше по критерию, а не насколько далеко друг от друга стоят их баллы.
Из матрицы сравнений модель Bradley–Terry восстанавливает для каждого ответа сравнительную полезность. Такие значения уже можно объединить с весами рубрики и нормализовать внутри группы. Вес отвечает за важность критерия, но больше не исправляет его исходную шкалу.
Если все ответы получили по критерию одинаковую оценку, он не влияет на их порядок. Поэтому уже освоенное требование почти не меняет обновление модели, а различия по более трудным критериям сохраняют влияние. Это возникает из устройства награды, а не из отдельного правила перераспределения весов.
Длину рассуждения и оформление метод вводит как сопутствующие признаки, а не как новые цели. Он совместно оценивает, насколько заголовки, списки, выделение или объём рассуждения связаны с решениями проверяющего модуля, и отделяет эту связь от полезности ответа. Модель не получает прямую награду за короткий текст или отсутствие разметки.
Для требований, которые нельзя компенсировать другими достоинствами, предусмотрены дополнительные барьеры. Провал глобальной проверки обнуляет награду, а низкое общее качество уменьшает её. Попарное ранжирование поэтому не отменяет жёсткие правила безопасности или корректности.
Когда RLVR² стоит включать в план
Метод проверяли на общей обучающей смеси из 120 тысяч запросов, трёх масштабах моделей семейств Qwen и GLM и шестнадцати публичных тестах. Набор охватывал выполнение инструкций, работу с длинным контекстом, фактическую точность, рассуждение, знания и открытый диалог; сравниваемые методы использовали одинаковые данные, рубрики и проверяющие модули.
На крупнейшем масштабе средний показатель полного варианта RLVR²+ составил 67,91 против 65,73 у Focal+, сильнейшего базового метода в этой таблице. RLVR² также занимал первое место на большинстве тестов при каждом масштабе, хотя преимущество зависело от конкретной задачи.
Работа меняет план, если продукт уже требует нескольких проверяемых критериев с разными шкалами. Вместо настройки коэффициентов для несопоставимых баллов можно оставить веса только для приоритетов продукта, а техническое согласование шкал заменить порядком ответов внутри группы. Особенно уместен такой переход там, где модель начала увеличивать длину или усложнять оформление ради награды.
Менять весь контур обучения не требуется: RLVR² работает после выставления оценок и не делает дополнительных обращений к проверяющим моделям. Однако системе всё равно нужны группы ответов на один запрос и вычисление попарной модели полезности. Для задач с единственным точным сигналом, например прохождением тестов кода, эта работа не даёт отдельного подтверждения пользы: эксперименты нацелены именно на многокритериальные рубрики.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



