Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Zixuan Fu и соавторы проверили, сколько обучающих запросов требуется для дистилляции LLM; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, один запрос охватил 71,5% состояний, посещённых при обучении на полной выборке. Результат важен командам, которые планируют дообучение моделей и оценивают затраты на подготовку данных.
Что сделали
Авторы исследовали дистилляцию на траекториях ученика (on-policy distillation, OPD). В этом методе модель-ученик генерирует ответы, а модель-учитель на каждом префиксе ответа показывает распределение вероятностей следующего токена. Поэтому единицей обучающего сигнала становится не исходный запрос, а состояние — запрос вместе с уже сгенерированной частью ответа.
Чтобы оценить разнообразие такого сигнала, исследователи представили состояния внутренними векторами учителя, сгруппировали их по смысловой близости и сравнили с состояниями из обучения на полной выборке. Добавление семантически различающихся запросов одновременно увеличивало покрытие состояний и точность на проверочных задачах. Набор из 16 запросов достиг покрытия 98,9% и по качеству сравнялся с полной выборкой.
При этом ученик продолжал сближаться с учителем сотни шагов независимо от размера набора. Авторы связывают ограничение скорости не с нехваткой примеров, а с тем, какую долю оставшегося расхождения между моделями устраняет очередное обновление.
Что это значит
Для OPD объём датасета сам по себе может быть слабой метрикой. Практический критерий из работы — разнообразие состояний, которые запросы вызывают в ответах ученика. Это смещает задачу подготовки данных от накопления примеров к отбору небольшого набора запросов с непересекающимися траекториями. Однако работа не устанавливает, что такой подход сокращает вычислительные расходы: даже с одним запросом остаются многочисленные генерации и сотни шагов оптимизации.
Ограничения. Эксперименты охватывают математические задачи, генерацию кода, следование инструкциям и работу с инструментами на моделях от 1,5 до 7 млрд параметров. Покрытие измеряется относительно состояний собственного полного запуска OPD, а все группы учитываются одинаково независимо от частоты посещения и силы сигнала учителя. Для режима с несколькими учителями проверены только три предметные области, а сравнения с альтернативными способами отбора данных по состояниям авторы не провели.
Источники
Иллюстрация: рисунок из статьи «Rethinking On-Policy Distillation of Large Language Models II: One Training Example», Zixuan Fu, Bingxiang He, Yuxin Zuo и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



