Журнал · Rit.work

Разные EOS-токены заставляют модель продолжать готовый ответ

При дистилляции ученик может подавлять собственный сигнал остановки, если учитель предпочитает другой EOS-токен; общий список стоп-токенов эту проблему не решает.

Rit.work
Студия разработки
18 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Ответы ученической модели при дистилляции могут разрастаться не из-за дополнительных рассуждений, а потому, что ученик и учитель по-разному обозначают конец текста. Команда Yuxiao Yang показала: объединение равнозначных EOS-токенов в одно действие остановки возвращало длину и долю обрезанных ответов к уровню учителя, тогда как общий список стоп-токенов для декодирования не помогал, хотя препринт не рецензирован и все числа получили сами авторы. Значит, при настройке обучения недостаточно синхронизировать параметры генерации — нужно менять сигнал дистилляции.

В дистилляции на собственных ответах (on-policy distillation) ученик генерирует текст, а учитель оценивает каждый выбранный токен. Если ученик завершает ответ своим EOS-токеном, но учитель предпочитает другой, алгоритм воспринимает остановку как ошибку и снижает её вероятность. При этом альтернативный токен почти не обучается: в опыте с Qwen3 ученик назначал предпочитаемому учителем EOS вероятность около 10−11 и практически никогда его не выбирал.

Из-за такого сигнала вероятность родного EOS-токена ученика падала примерно с 0,8 почти до нуля. Модель успевала дать правильный ответ, но затем продолжала писать повторяющиеся или лишние фрагменты, пока не исчерпывала лимит генерации. Простое добавление обоих токенов в список остановки не меняло их вероятности и поэтому не исправляло поведение.

Авторы сравнили четыре способа обработки завершения. Рабочий вариант складывает вероятности всех функционально равнозначных EOS-токенов и обучает их как единое действие «остановиться». Проверку провели на Qwen3, Llama и Gemma, обученных на DAPO-Math-17K для одношаговых математических задач; основной опыт использовал Qwen3-1.7B-Base как ученика и Qwen3-4B как учителя.

Разбор промежуточных версий K2-Horizon показал границу метода: ближе к концу обучения ответы снова начинали расти, даже когда конфликт EOS уже устранили. Для многошаговых диалогов и агентов результат тоже нельзя переносить напрямую — там разные токены могут завершать сообщение, весь документ или передачу управления инструменту, поэтому объединять их без учёта роли нельзя.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу