Журнал · Rit.work

Для дистилляции модели хватило вопросов от самого учителя

DF-OPD убирает внешний набор задач: учитель сам создаёт вопросы, а затем направляет ученика на его собственных траекториях.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель-учитель смогла сама написать вопросы для обучения ученика, поэтому внешний набор задач в экспериментах перестал быть обязательным. В препринте, который не прошёл рецензирование и в котором числа получили сами авторы, такие вопросы дали результат не хуже реальных данных. Для команд, уже выбравших OPD, доступ к исходным данным учителя больше не выглядит обязательным условием.

Почему восемь задач заменили набор из 17 тысяч

Дистилляция на траекториях ученика (on-policy distillation, OPD) устроена иначе, чем обучение на готовых ответах. Ученик сам генерирует решение, а учитель на каждом шаге показывает, какие следующие токены считает более вероятными.

Единицей обучения становится не исходный вопрос, а состояние: вопрос вместе с уже написанной частью ответа. Повторный запуск одного задания приводит ученика к другим формулировкам, промежуточным выводам и ошибкам. Учитель каждый раз получает новые места, где может скорректировать поведение.

Поэтому разнообразие вопросов быстро перестаёт быть главным источником сигнала. В связке, где учителя получили из ученика через RL, восьми математических задач хватило, чтобы сравняться с набором из 17 тысяч. Во второй связке, где учитель был крупнее ученика, картина сохранилась.

Авторы сравнили независимо собранные математические наборы DAPO, DeepMath и ORZ. Они заметно различались по сложности и по тому, насколько расходились ответы учителя и ученика, но дали почти одинаковые кривые обучения.

Замена математики задачами по спортивному программированию сохранила более 90% прироста на математических тестах. Это указывает, что OPD передаёт прежде всего способ рассуждать и исправлять промежуточные шаги, а не знания из конкретного набора задач.

Малые наборы повторяли до полного пакета, поэтому все варианты получали одинаковое число траекторий и шагов обновления весов. Эксперимент показывает, что можно сократить разнообразие исходных вопросов, но не вычисления: ученик по-прежнему должен строить траектории, а учитель — оценивать их токен за токеном.

Как учитель создаёт данные для собственного ученика

В DF-OPD учителю дают простую инструкцию написать учебные вопросы. Их не берут из внешнего источника, не дополняют исходным набором и не фильтруют. Затем ученик отвечает на эти вопросы, а тот же учитель направляет его на возникающих траекториях.

Для одного учителя 64 самостоятельно созданных вопроса совпали по результату с обучением на всех 17 тысячах задач DAPO-Math или превзошли его. Сгенерированные вопросы также воспроизвели характер обучения на данных, с которыми ранее донастраивали учителя, точнее, чем сторонние реальные наборы.

Особенно практичен этот подход при объединении нескольких профильных учителей. Обычной схеме нужны не только вопросы, но и метки предметной области, чтобы направить каждую траекторию к нужной модели. Если учитель сам пишет вопрос, тот автоматически наследует его область.

В опыте с математикой, кодом и выполнением инструкций тысяча сгенерированных вопросов закрыла 98,5% разницы между исходным учеником и системой, которая направляет запрос профильному учителю. Этот результат оказался выше обучения на семи тысячах реальных примеров.

Работу проверяли на двух типичных связках с одним учителем: учитель после RL-донастройки исходного ученика и более крупный учитель из того же семейства. Отдельный опыт с несколькими учителями охватывал три предметные области. На коде сгенерированные вопросы закрыли 80% разрыва против 88% у реальных данных, поэтому общий результат ещё не означает равенства в каждой области.

Меняет ли DF-OPD планы разработки

Если команда уже собиралась применять OPD, работу с данными можно начинать не с покупки, разметки и фильтрации большого корпуса. Сначала достаточно попросить доступного учителя создать небольшой банк вопросов и проверить, воспроизводится ли эффект на целевых тестах продукта.

Это снимает отдельный организационный барьер: веса учителя можно использовать, даже если набор для его послетренировочной настройки недоступен. В схеме с несколькими учителями также не придётся отдельно восстанавливать пары «вопрос — предметная область».

Экономию данных не следует путать с экономией всей тренировки. OPD требует запускать ученика, получать распределения токенов от учителя и хранить плотный обучающий сигнал. Для крупного учителя вычисления и обмен результатами между моделями могут остаться основной статьёй затрат.

Вывод относится именно к OPD и проверенным связкам моделей. Он не переносится автоматически на SFT, где обучающий ответ фиксирован, или на RL, где модель получает итоговую награду вместо подсказки на каждом шаге. Практический план меняется точечно: внешний корпус перестаёт быть обязательной отправной точкой, но собственная проверка по областям остаётся необходимой.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу