Журнал · Rit.work

Два учителя отделяют правильность от поведения модели

Контрастная самодистилляция улучшила рассуждения Qwen3-4B и удержала длину ответов под контролем без дополнительного обучения через GRPO.

Rit.work
Студия разработки
21 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Сигнал правильности при дообучении модели можно отделить от привычек, которые она перенимает вместе с готовым решением. В препринте ETH Zurich и Max Planck Institute for Intelligent Systems, который не прошёл рецензирование и приводит замеры самих авторов, контрастная самодистилляция улучшала решение задач в трёх режимах Qwen3-4B без неконтролируемого роста ответов. Такой подход позволяет обучать модель по плотному сигналу для каждого токена без отдельной модели-учителя и дополнительной цели GRPO.

При самодистилляции модель сначала генерирует ответ, а затем сама оценивает его, получив скрытую от исходного ответа подсказку. Авторы использовали двух учителей: один видел правильное решение, другой — неправильное. Обучение поровну притягивало модель к первому и отталкивало от второго, поэтому общие изменения стиля компенсировали друг друга, а различия, связанные с правильностью, сохранялись.

Одностороннее притяжение делало ответы короче и увереннее, но подавляло проверку и поиск альтернатив. Отталкивание давало противоположный эффект: ответы разрастались, а гибридная модель самопроизвольно включала уже существующий режим рассуждения. Она при этом не обходила исходную модель с включённым режимом рассуждения, а дальнейший рост ответа приводил к обрезанию и падению качества. У модели без отдельного режима рассуждения отталкивание тоже закончилось ростом длины и срывом обучения.

Метод проверили на Qwen3-4B без режима рассуждения и на Qwen3-4B-Instruct-2507 в задачах DeepMath с оценкой на шести математических наборах. Ещё один запуск использовал Qwen3-4B с уже включённым рассуждением на Group Anagrams и четырёх уровнях сложности. Контрастную схему сравнивали с односторонним притяжением, отталкиванием и GRPO; во всех трёх режимах она улучшала итоговую оценку, сохраняя устойчивую длину ответа. Проверка ограничена одной модельной семьёй и двумя типами задач, поэтому для производственного выбора нужны замеры на целевой модели и данных.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу