Журнал · Rit.work

Почему порядок постобучения LLM меняет результат

Эксперименты с Qwen3 показали: удачный этап постобучения может помешать следующему, а размер модели-учителя не гарантирует качественную передачу навыков.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Порядок этапов постобучения LLM может улучшить или испортить передачу навыков между моделями. В препринте Salesforce AI Research и UIUC, который не проходил рецензирование, сами авторы получили рост средней точности с 29,2% до 43,8% после подготовки учителя и ученика. Значит, этапы нельзя выбирать отдельно: важен результат, с которым модель приходит к следующему способу обучения.

Работа сравнивает три подхода. SFT обучает модель с учителем на готовых правильных ответах. RLVR использует обучение с подкреплением и награждает модель за автоматически проверяемый итог, а OPD дистиллирует знания на ответах самого ученика: модель-учитель оценивает каждый сгенерированный токен.

Короткая подготовка ученика через SFT помогла последующей OPD, но подготовка через RLVR дала обратный эффект. После RLVR ученик начинал дистилляцию с точностью 38,5%, однако к её завершению опускался до 28,4% при работе с тем же учителем. При этом модель продолжала точнее воспроизводить распределение ответов учителя. Близость к учителю сама по себе не гарантировала правильных решений.

Лучшей оказалась последовательность, в которой учителя сначала адаптировали через RLVR, ученика ненадолго готовили через SFT, а затем запускали OPD. Рост с 29,2% до 43,8% получили при одинаковом числе шагов дистилляции, но с дополнительным подготовительным обучением. Это не бесплатный прирост, а аргумент в пользу совместного проектирования всего конвейера и явных точек передачи между этапами.

Основные эксперименты провели с Qwen3-4B-Base в роли ученика и Qwen3-14B в роли учителя на шести математических и одном научном бенчмарке. Дополнительно дистилляцию проверили на девяти парах Qwen3 разных размеров. В этих условиях крупнейший учитель не всегда передавал знания лучше: результат зависел от совместимости конкретной пары и способа подготовки моделей.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу