Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Порядок этапов постобучения LLM может улучшить или испортить передачу навыков между моделями. В препринте Salesforce AI Research и UIUC, который не проходил рецензирование, сами авторы получили рост средней точности с 29,2% до 43,8% после подготовки учителя и ученика. Значит, этапы нельзя выбирать отдельно: важен результат, с которым модель приходит к следующему способу обучения.
Работа сравнивает три подхода. SFT обучает модель с учителем на готовых правильных ответах. RLVR использует обучение с подкреплением и награждает модель за автоматически проверяемый итог, а OPD дистиллирует знания на ответах самого ученика: модель-учитель оценивает каждый сгенерированный токен.
Короткая подготовка ученика через SFT помогла последующей OPD, но подготовка через RLVR дала обратный эффект. После RLVR ученик начинал дистилляцию с точностью 38,5%, однако к её завершению опускался до 28,4% при работе с тем же учителем. При этом модель продолжала точнее воспроизводить распределение ответов учителя. Близость к учителю сама по себе не гарантировала правильных решений.
Лучшей оказалась последовательность, в которой учителя сначала адаптировали через RLVR, ученика ненадолго готовили через SFT, а затем запускали OPD. Рост с 29,2% до 43,8% получили при одинаковом числе шагов дистилляции, но с дополнительным подготовительным обучением. Это не бесплатный прирост, а аргумент в пользу совместного проектирования всего конвейера и явных точек передачи между этапами.
Основные эксперименты провели с Qwen3-4B-Base в роли ученика и Qwen3-14B в роли учителя на шести математических и одном научном бенчмарке. Дополнительно дистилляцию проверили на девяти парах Qwen3 разных размеров. В этих условиях крупнейший учитель не всегда передавал знания лучше: результат зависел от совместимости конкретной пары и способа подготовки моделей.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



