Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель-учитель смогла сама написать вопросы для обучения ученика, поэтому внешний набор задач в экспериментах перестал быть обязательным. В препринте, который не прошёл рецензирование и в котором числа получили сами авторы, такие вопросы дали результат не хуже реальных данных. Для команд, уже выбравших OPD, доступ к исходным данным учителя больше не выглядит обязательным условием.
Почему восемь задач заменили набор из 17 тысяч
Дистилляция на траекториях ученика (on-policy distillation, OPD) устроена иначе, чем обучение на готовых ответах. Ученик сам генерирует решение, а учитель на каждом шаге показывает, какие следующие токены считает более вероятными.
Единицей обучения становится не исходный вопрос, а состояние: вопрос вместе с уже написанной частью ответа. Повторный запуск одного задания приводит ученика к другим формулировкам, промежуточным выводам и ошибкам. Учитель каждый раз получает новые места, где может скорректировать поведение.
Поэтому разнообразие вопросов быстро перестаёт быть главным источником сигнала. В связке, где учителя получили из ученика через RL, восьми математических задач хватило, чтобы сравняться с набором из 17 тысяч. Во второй связке, где учитель был крупнее ученика, картина сохранилась.
Авторы сравнили независимо собранные математические наборы DAPO, DeepMath и ORZ. Они заметно различались по сложности и по тому, насколько расходились ответы учителя и ученика, но дали почти одинаковые кривые обучения.
Замена математики задачами по спортивному программированию сохранила более 90% прироста на математических тестах. Это указывает, что OPD передаёт прежде всего способ рассуждать и исправлять промежуточные шаги, а не знания из конкретного набора задач.
Малые наборы повторяли до полного пакета, поэтому все варианты получали одинаковое число траекторий и шагов обновления весов. Эксперимент показывает, что можно сократить разнообразие исходных вопросов, но не вычисления: ученик по-прежнему должен строить траектории, а учитель — оценивать их токен за токеном.
Как учитель создаёт данные для собственного ученика
В DF-OPD учителю дают простую инструкцию написать учебные вопросы. Их не берут из внешнего источника, не дополняют исходным набором и не фильтруют. Затем ученик отвечает на эти вопросы, а тот же учитель направляет его на возникающих траекториях.
Для одного учителя 64 самостоятельно созданных вопроса совпали по результату с обучением на всех 17 тысячах задач DAPO-Math или превзошли его. Сгенерированные вопросы также воспроизвели характер обучения на данных, с которыми ранее донастраивали учителя, точнее, чем сторонние реальные наборы.
Особенно практичен этот подход при объединении нескольких профильных учителей. Обычной схеме нужны не только вопросы, но и метки предметной области, чтобы направить каждую траекторию к нужной модели. Если учитель сам пишет вопрос, тот автоматически наследует его область.
В опыте с математикой, кодом и выполнением инструкций тысяча сгенерированных вопросов закрыла 98,5% разницы между исходным учеником и системой, которая направляет запрос профильному учителю. Этот результат оказался выше обучения на семи тысячах реальных примеров.
Работу проверяли на двух типичных связках с одним учителем: учитель после RL-донастройки исходного ученика и более крупный учитель из того же семейства. Отдельный опыт с несколькими учителями охватывал три предметные области. На коде сгенерированные вопросы закрыли 80% разрыва против 88% у реальных данных, поэтому общий результат ещё не означает равенства в каждой области.
Меняет ли DF-OPD планы разработки
Если команда уже собиралась применять OPD, работу с данными можно начинать не с покупки, разметки и фильтрации большого корпуса. Сначала достаточно попросить доступного учителя создать небольшой банк вопросов и проверить, воспроизводится ли эффект на целевых тестах продукта.
Это снимает отдельный организационный барьер: веса учителя можно использовать, даже если набор для его послетренировочной настройки недоступен. В схеме с несколькими учителями также не придётся отдельно восстанавливать пары «вопрос — предметная область».
Экономию данных не следует путать с экономией всей тренировки. OPD требует запускать ученика, получать распределения токенов от учителя и хранить плотный обучающий сигнал. Для крупного учителя вычисления и обмен результатами между моделями могут остаться основной статьёй затрат.
Вывод относится именно к OPD и проверенным связкам моделей. Он не переносится автоматически на SFT, где обучающий ответ фиксирован, или на RL, где модель получает итоговую награду вместо подсказки на каждом шаге. Практический план меняется точечно: внешний корпус перестаёт быть обязательной отправной точкой, но собственная проверка по областям остаётся необходимой.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



