Журнал · Rit.work

CC-OPD учит LLM соблюдать несколько ограничений без внешней проверки

CC-OPD выделяет вклад каждого требования через замороженного учителя и точнее обучает LLM соблюдать сложные инструкции без отдельной проверяющей модели.

Rit.work
Студия разработки
24 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковую модель научили точнее соблюдать несколько требований в одном запросе, не подключая к обучению внешний верификатор. Хотя работу не рецензировали и все числа получили сами авторы, ученик с 1,5 млрд параметров обошёл своего учителя с 7 млрд на MulDimIF. Метод даёт командам альтернативу обучению с правилами и моделями-оценщиками, если есть прямой доступ к вероятностям токенов учителя.

Как удаление одного требования даёт обучающий сигнал

Команда Alibaba Group назвала метод CC-OPD. Он дополняет дистилляцию на собственных ответах: ученик генерирует текст, а замороженный учитель оценивает вероятность каждого выпущенного токена. Обычная дистилляция сравнивает ученика с учителем, который видит запрос целиком.

При нескольких требованиях такой сигнал трудно разделить. Например, запрос может одновременно задавать формат списка, предел длины, тон и запрет на отдельные слова. Учитель учитывает всё сразу, поэтому по его итоговой вероятности нельзя понять, какое требование поддержало конкретный токен.

CC-OPD один раз получает ответ ученика на полный запрос. Затем учитель оценивает тот же готовый ответ сначала со всеми требованиями, а после — несколько раз, каждый раз без одного из них. Новые ответы генерировать не нужно: во всех проходах меняется только запрос.

Разница между двумя оценками показывает вклад удалённого требования. Если с требованием учитель считает токен более вероятным, токен получает положительный сигнал. Почти нулевая разница означает, что требование на него не влияет. Отрицательная указывает, что требование скорее подавляет такой выбор.

Сигналы от отдельных требований складывают, симметрично ограничивают, чтобы редкий токен не перетянул обновление модели, и добавляют к обычной награде OPD. Если сумма равна нулю, обучение для этого токена полностью совпадает с исходным OPD. Ученик при этом всегда видит полный запрос — контрфактические варианты нужны только учителю во время обучения.

Удаление требования из полного набора сохраняет взаимодействия между оставшимися условиями. Это отличает метод от варианта, где учителю по очереди показывают каждое требование отдельно: такой подход теряет зависимости вроде совместного влияния формата и предела длины.

Меньшая Qwen обошла учителя на MulDimIF

Метод проверили на парах Qwen2.5-1.5B и Qwen2.5-7B, а также на ученике и учителе Qwen3-4B. Учителей предварительно обучили на HIR-16K с GRPO. Тестовый набор включал IFEval, IFBench, MulDimIF, ComplexBench, InfoBench, FollowBench и CFBench; метрика засчитывала ответ, только если он выполнил все требования запроса.

Сравнение охватило обычное дообучение на готовых ответах, GRPO с общей и покритериальной наградой, исходный OPD, несколько его вариантов и обучение с внешней проверкой. Для Qwen2.5-1.5B средняя точность CC-OPD составила 51,4% против 47,6% у обычного OPD; лучший другой вариант OPD набрал 48,9%.

На MulDimIF ученик показал 72,9%, а его более крупный учитель — 70,1%. В паре Qwen3 метод также получил лучший средний результат среди способов обучения, хотя не занял первое место на каждом отдельном тесте. Это важнее единичной победы: контрфактический сигнал переносился между несколькими типами ограничений и проверок.

Масштаб проверки остаётся узким: использованы только модели Qwen, один обучающий корпус и дистилляция с обратной дивергенцией KL по выбранным учеником токенам. Многоходовые диалоги и управление через системные инструкции в эксперименты не входили.

Когда CC-OPD меняет план дообучения

CC-OPD стоит включить в план экспериментов, если продукт должен одновременно соблюдать формат, стиль, ограничения длины, запреты и правила цитирования. Особенно хорошо метод совпадает со сценарием, где требования уже записаны отдельными фразами и каждую можно удалить из запроса, не разрушив остальной текст.

Отдельная проверяющая модель во время дистилляции не нужна. Это убирает этап подготовки критериев, разметки ответов и обучения оценщика, но не делает обучение бесплатным: для запроса с набором ограничений учитель выполняет один проход с полным набором и ещё по проходу без каждого требования.

Поэтому метод требует учителя, который доступен внутри обучающего контура и возвращает вероятности токенов. Модель, доступная только через API генерации текста, для описанной схемы не подходит. Дополнительные проходы также придётся учитывать при расчёте памяти, пропускной способности и времени обучения.

На рабочем продукте вычислительная схема не меняется: после дистилляции отвечает только ученик и получает обычный полный запрос. Метод влияет на подготовку модели, а не добавляет проверку к каждому пользовательскому ответу.

Практический следующий шаг — сравнить CC-OPD с уже настроенным OPD при одинаковом вычислительном бюджете и отдельно проверить самые частые сочетания требований продукта. Для шаблонов со структурированными полями понадобится собственный способ аккуратно удалять одно условие: в работе контрфактические запросы строили удалением заранее известных фрагментов естественного языка.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу