Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Авторы из нескольких исследовательских групп разработали DE-Venus — фреймворк для экономного обучения LLM с подкреплением и проверяемой наградой (RLVR), описанный в препринте, который не проходил рецензирования. В отдельных конфигурациях качество сохранилось или выросло при использовании 10% меток по сравнению с полностью контролируемым обучением. Работа важна командам, которые дообучают модели рассуждать на дорогой, неполной или зашумлённой разметке.
Что сделали
В RLVR модель генерирует несколько траекторий решения, проверяющий компонент оценивает конечные ответы, а оптимизатор усиливает более успешные варианты. Такой цикл расходует вычисления даже на уже освоенные или слишком сложные задания. Кроме того, для специализированных продуктов сложно подготовить достаточно эталонных ответов, качество которых можно автоматически проверить.
DE-Venus рассматривает обучающий сигнал не как постоянное поле примера, а как изменяемое состояние. Для каждого задания можно хранить происхождение ответа, степень доверия к нему и решение о том, следует ли использовать пример, отправить его на разметку или пересмотреть после очередного раунда обучения.
Работа с этим состоянием разделена на несколько участков. До обучения активный отбор данных оценивает сложность и неопределённость примеров, распределяя бюджеты разметки и вычислений. Во время генерации слабая разметка получает временные ответы или награды из согласия между траекториями, уверенности модели и других внутренних сигналов. На этапе обновления дополнительная проверка отбрасывает ненадёжные группы траекторий, меняет их вес либо предлагает исправить исходную метку.
Специализированная логика не встраивается непосредственно в распределённый механизм обучения. DE-Venus оставляет verl генерацию, размещение моделей на GPU, оптимизацию, проверку и сохранение контрольных точек. Методы взаимодействуют с ним через ожидаемые объекты: наборы данных Parquet, цели, награды, отфильтрованные пакеты и веса обновления. Благодаря этому новый способ отбора или очистки данных не требует создавать отдельную версию всей обучающей системы.
Модули не образуют обязательную последовательность. Проект может использовать только предварительный отбор, только построение слабых сигналов или очистку уже имеющейся разметки. Изменения между запусками сохраняются в версионированном наборе данных, а временные решения внутри шага обучения остаются в памяти и не меняют исходные метки незаметно.
Что показали
По замерам авторов, в задаче следования инструкциям выбранная конфигурация сохранила 13% обучающих примеров и примерно соответствовала полной выборке по основной метрике. Наблюдаемое число шагов до сходимости сократилось на 63–75% в двух сценариях внутренней безопасности. Это число относится именно к шагам оптимизации, а не к длительности запуска или расходу GPU.
В сценарии назначения кредитного лимита фильтрация слабых сигналов дала до 14 нормализованных пунктов относительно обучения только на размеченных данных. Простое добавление неразмеченных примеров, напротив, не улучшило результат: выигрыш авторы связывают с отбором сигналов по надёжности.
В сценарии обучения медицинской эмпатии фильтр исключил 28% примеров с сомнительной динамикой награды. Итоговая оценка осталась в пределах 1,9 пункта от обучения на полном наборе. Здесь результатом стала экономия объёма обучения с ограниченной потерей качества, а не новый максимум метрики.
Ограничения
Авторы проверяли отдельные конфигурации на публичных задачах математического и общего рассуждения, а также в трёх прикладных сценариях: кредитном скоринге, медицинской эмпатии и внутренней безопасности. Названия внутренних моделей и абсолютные бизнес-метрики скрыты, а результаты нормализованы отдельно для каждого сценария. Поэтому их нельзя сопоставлять между сценариями или переносить на метрики конкретного продукта без собственной проверки.
Работа не показывает, что объединение всех модулей в одном запуске лучше каждого метода по отдельности. Также не измерены итоговая длительность обучения, расход GPU и денежная стоимость: сокращение данных и шагов оптимизации служит косвенной оценкой экономии. Сравнения проведены авторами в собственной реализации поверх verl; независимого воспроизведения и прямого сравнения с другим унифицированным фреймворком в представленных материалах нет.
Что это значит
Для команды, уже строящей RLVR поверх verl, работа может изменить архитектурный план. Логику качества разметки имеет смысл вынести в отдельный управляющий слой, а в основном контуре оставить генерацию, проверку, оптимизацию и распределённое выполнение. Это уменьшает риск получить несколько несовместимых обучающих конвейеров для отбора данных, псевдометок и исправления ошибок.
Практически полезна модель данных DE-Venus: стабильный идентификатор примера, источник сигнала, его статус, история изменения и разделение временных и постоянных решений. Такой контракт позволяет повторно использовать один набор инструментов проверки и сравнивать методы при одинаковой вычислительной инфраструктуре.
Менять выбранный стек только на основании этой работы рано. DE-Venus не доказывает экономию для произвольной модели или предметной области, а выигрыш зависит от того, способен ли проект надёжно оценивать ответы и отличать полезную слабую разметку от шума. Для действующего конвейера разумный следующий шаг — проверить один узкий участок, например отбор примеров или фильтрацию траекторий, и измерить качество вместе с фактическими GPU-часами.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



