Журнал · Rit.work

LastOPD ограничивает скрытый сигнал учителя, прежде чем он разрушит ученика

LastOPD передаёт ученику скрытые состояния только в начале обучения, а затем переключается на токены, чтобы сохранить быстрый прирост без последующего обвала.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Скрытые состояния крупной языковой модели помогают быстро обучить меньшую, но постоянное выравнивание слоёв в итоге ломает её ответы. В препринте команд University of Illinois at Chicago, Visa Research и других организаций, который не прошёл рецензирование и содержит замеры самих авторов, LastOPD превзошёл обычную дистилляцию на MATH-500 на 5,55 пункта точности. Практический вывод — давать ученику внутренний сигнал лишь в начале, а затем учить его по вероятностям токенов.

Точное совпадение состояний не гарантирует правильный ответ

При дистилляции на собственных ответах ученик генерирует текст, а учитель оценивает вероятность каждого следующего токена. Такое обучение исправляет модель именно в тех контекстах, куда она попадает сама, но передаёт только итоговое распределение токенов.

Скрытый сигнал добавляет состояния слоёв до выходного слоя, который превращает их в вероятности следующего токена. В OPRD слои учителя и ученика сопоставляют по относительной глубине, а разницу в ширине моделей компенсирует проектор. Предполагается, что соответствующие слои выполняют похожую работу.

Эксперимент показал обратную сторону этого предположения. На MATH-500 точность ученика выросла с 25,4 до 46,2 за десять шагов, а при продолжении обучения упала до 11,3 — ниже исходного уровня. При этом метрика сходства скрытых состояний продолжала улучшаться.

Диагностика J-Lens показала, что учитель и ученик распределяют вычисления по глубине по-разному. У учителя промежуточная информация возникает рано, но становится читаемой как следующий токен лишь в последних слоях. Ученик выводит промежуточные результаты постепенно, поэтому одинаковая относительная глубина не означает одинаковую функцию слоя.

Высокое сходство тоже оказалось ненадёжным ориентиром. На метрику сильно влияли несколько измерений с аномально крупными активациями. Однако их маскирование не устранило обвал, как и подбор пар слоёв по сходству вместо глубины. Проблема оказалась не только в выборе метрики: постоянная цель заставляла ученика копировать состояния, которые не помогали его собственным предсказаниям.

LastOPD оставляет скрытый сигнал только в точке общего смысла

LastOPD не сопоставляет промежуточные слои. Метод выравнивает только последние скрытые состояния учителя и ученика непосредственно перед их выходными слоями. В этой точке оба состояния решают одну понятную задачу — подготовить распределение следующего токена.

Разницу в ширине моделей закрывает небольшой обучаемый многослойный перцептрон. Учитель остаётся замороженным, а ученик генерирует собственные ответы, поэтому исправления по-прежнему относятся к его реальным траекториям, а не к заранее написанным ответам учителя.

В начале обучения работает только скрытый сигнал. За десять шагов его вес линейно снижается до нуля, а вес обычной дистилляции по токенам растёт. После перехода обучение полностью продолжается по токенам.

Такое расписание важнее, чем простое сложение двух целей. Если оставить скрытый сигнал до конца вместе с токенным, итог почти не отличается от обычной дистилляции. Более короткое и более длинное окно также давали худший результат, поэтому выбранную длительность пока следует считать настройкой проверанного эксперимента, а не универсальной константой.

Для конвейера обучения меняется расписание, а не модель в продакшене

Основные опыты передавали знания от Qwen3-4B и Qwen3-8B в Qwen3-1.7B-Base. Модели обучали на DAPO-Math-17k, основной результат измеряли на MATH-500 и дополнительно проверяли на восьми отложенных наборах. LastOPD сравнивали с токенной дистилляцией, OPRD и вариантами, где скрытая цель работала постоянно.

Прирост сохранился с обоими учителями и на большинстве отложенных наборов. LastOPD также достигал конечного результата токенной дистилляции примерно вдвое быстрее. Продлённый запуск удерживал результат после отключения скрытой цели, тогда как OPRD с постоянным выравниванием не восстановился.

Для команд с уже работающей дистилляцией это не требует менять архитектуру ученика на этапе вывода. Изменения относятся к постобучению: нужно получать последнее скрытое состояние учителя, добавить проектор и плавно выключить новую цель в начале запуска.

Работа даёт основание проверить короткий скрытый разгон рядом с текущим токенным обучением, особенно когда учитель и ученик отличаются глубиной и шириной. Переносить конкретное расписание без проверки рано: основные замеры сделаны на моделях Qwen с общими словарём и разбиением текста на токены, преимущественно на математических задачах.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу