Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Наградную модель научили меняться вместе с моделью рассуждений, чтобы она не оценивала новые ответы по устаревшим критериям. В нерецензированном препринте HKUST, Huawei Noah’s Ark Lab и Tencent HY все числа получили сами авторы: после обучения через DCRL модель Qwen3-4B обошла Qwen3-32B на каждом проверенном наборе задач. Для команд, которые дообучают LLM с подкреплением, работа предлагает обновлять не только основную модель, но и её оценщика.
Статичная награда отстаёт от обучаемой модели
При обучении с подкреплением политика, то есть основная обучаемая модель, генерирует ответы и получает за них награду. Награду могут задавать правила: совпал числовой ответ, прошёл кодовые тесты, соблюдён формат. Такой способ хорошо проверяет закрытые задачи, но модель может научиться использовать слабое место правила вместо того, чтобы решать задачу лучше.
Другой вариант — отдельная LLM, которая оценивает ответ. Она учитывает больше признаков, чем формальная проверка, но обычно остаётся неизменной, пока политика обновляется. По мере обучения политика начинает выдавать ответы, которых статичный оценщик раньше не встречал, и связь между наградой и реальным качеством может ослабнуть.
DCRL описывает эту проблему через геометрию внутренних представлений. Рассуждение разделено на связанные области: логический вывод, оценку и выражение результата в тексте. При генерации ответа модель связывает вывод с текстом, а при проверке — оценку с текстом. Если политика меняет первую связь, а наградная модель сохраняет вторую без изменений, их представления постепенно расходятся.
Это геометрическое описание служит не самостоятельным доказательством качества, а схемой для устройства обучения. Расхождение проверяют по сходству внутренних представлений: у DCRL оно оставалось выше, чем у варианта с неподвижной наградной моделью, на задачах по математике, программированию и здравому смыслу.
Как DCRL связывает политику и оценщика
DCRL строится поверх обычного алгоритма обучения с подкреплением, например GRPO. Отличие находится в наградной модели: её инструкция для оценки состоит из трёх уровней. Аксиомы задают общие требования к хорошему ответу и не меняются; теоремы описывают правила конкретной области; следствия уточняют критерии под текущее поведение политики.
На каждой эпохе политика генерирует ответы, а наградная модель оценивает их по текущей инструкции. Затем алгоритм обновляет политику с учётом преимущества ответа — разницы между его наградой и базовым уровнем. После этого DCRL переписывает следствия, опираясь на качество ответов и ход обучения. При смене области он может обновить и уровень теорем.
Самая заметная деталь метода следует дальше: в конце эпохи веса обновлённой политики напрямую копируются в наградную модель. Оценщик наследует новые способности основной модели, но получает другую роль через инструкцию с критериями. На следующей эпохе он уже оценивает ответы из того распределения, к которому сам стал ближе.
Авторы также выводят условие, при котором расхождение между внутренними представлениями политики и оценщика остаётся ограниченным. На практике важнее, что метод соединяет два механизма: обновляет текстовые критерии и синхронизирует веса моделей. Удаление любого из них приводило к более раннему выходу качества на плато.
Эксперименты запускали на сервере с восемью NVIDIA A100. Длительность прогонов в тексте не указана, поэтому по работе нельзя рассчитать стоимость такого обучения для собственного продукта.
DCRL меняет план эксперимента, но не выбор основной модели
Качество измеряли через pass@5 — долю задач, где хотя бы одна из пяти попыток дала верный результат. На AIME24 DCRL получил 40% против 33,33% у статичной наградной модели. На GPQA разрыв составил 77,27% против 64,75%. Полная версия также обошла награды на основе правил и статичного оценщика на каждом проверенном наборе.
Сравнение с крупными моделями требует осторожной трактовки. DCRL-4B превзошла Qwen3-32B во всех экспериментах, но на большинстве наборов всё ещё уступила Qwen3-235B. Результат показывает, что способ дообучения может компенсировать часть разницы в размере, но не подтверждает общую замену крупной модели малой.
Метод проверяли только с политикой семейства Qwen3 на математике, коде и задачах на здравый смысл. В тестах были как знакомые распределения, так и отдельные наборы вне обучающего распределения. Правильность определяли по числовому совпадению, прохождению модульных тестов или точному совпадению финального ответа, поэтому работа лучше описывает проверяемые рассуждения, чем диалоги с субъективными требованиями.
Для продуктовой команды DCRL не требует немедленно менять базовую модель или производственный контур. Он меняет план следующего эксперимента, если собственное обучение уже упирается в статичного оценщика: стоит сравнить неподвижную награду с совместным обновлением политики, критериев и весов наградной модели. При этом итог нужно проверять по целевой метрике продукта, а не по росту самой награды — иначе новый оценщик может просто перенести проблему в более сложную форму.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



