Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Скрытые состояния крупной языковой модели помогают быстро обучить меньшую, но постоянное выравнивание слоёв в итоге ломает её ответы. В препринте команд University of Illinois at Chicago, Visa Research и других организаций, который не прошёл рецензирование и содержит замеры самих авторов, LastOPD превзошёл обычную дистилляцию на MATH-500 на 5,55 пункта точности. Практический вывод — давать ученику внутренний сигнал лишь в начале, а затем учить его по вероятностям токенов.
Точное совпадение состояний не гарантирует правильный ответ
При дистилляции на собственных ответах ученик генерирует текст, а учитель оценивает вероятность каждого следующего токена. Такое обучение исправляет модель именно в тех контекстах, куда она попадает сама, но передаёт только итоговое распределение токенов.
Скрытый сигнал добавляет состояния слоёв до выходного слоя, который превращает их в вероятности следующего токена. В OPRD слои учителя и ученика сопоставляют по относительной глубине, а разницу в ширине моделей компенсирует проектор. Предполагается, что соответствующие слои выполняют похожую работу.
Эксперимент показал обратную сторону этого предположения. На MATH-500 точность ученика выросла с 25,4 до 46,2 за десять шагов, а при продолжении обучения упала до 11,3 — ниже исходного уровня. При этом метрика сходства скрытых состояний продолжала улучшаться.
Диагностика J-Lens показала, что учитель и ученик распределяют вычисления по глубине по-разному. У учителя промежуточная информация возникает рано, но становится читаемой как следующий токен лишь в последних слоях. Ученик выводит промежуточные результаты постепенно, поэтому одинаковая относительная глубина не означает одинаковую функцию слоя.
Высокое сходство тоже оказалось ненадёжным ориентиром. На метрику сильно влияли несколько измерений с аномально крупными активациями. Однако их маскирование не устранило обвал, как и подбор пар слоёв по сходству вместо глубины. Проблема оказалась не только в выборе метрики: постоянная цель заставляла ученика копировать состояния, которые не помогали его собственным предсказаниям.
LastOPD оставляет скрытый сигнал только в точке общего смысла
LastOPD не сопоставляет промежуточные слои. Метод выравнивает только последние скрытые состояния учителя и ученика непосредственно перед их выходными слоями. В этой точке оба состояния решают одну понятную задачу — подготовить распределение следующего токена.
Разницу в ширине моделей закрывает небольшой обучаемый многослойный перцептрон. Учитель остаётся замороженным, а ученик генерирует собственные ответы, поэтому исправления по-прежнему относятся к его реальным траекториям, а не к заранее написанным ответам учителя.
В начале обучения работает только скрытый сигнал. За десять шагов его вес линейно снижается до нуля, а вес обычной дистилляции по токенам растёт. После перехода обучение полностью продолжается по токенам.
Такое расписание важнее, чем простое сложение двух целей. Если оставить скрытый сигнал до конца вместе с токенным, итог почти не отличается от обычной дистилляции. Более короткое и более длинное окно также давали худший результат, поэтому выбранную длительность пока следует считать настройкой проверанного эксперимента, а не универсальной константой.
Для конвейера обучения меняется расписание, а не модель в продакшене
Основные опыты передавали знания от Qwen3-4B и Qwen3-8B в Qwen3-1.7B-Base. Модели обучали на DAPO-Math-17k, основной результат измеряли на MATH-500 и дополнительно проверяли на восьми отложенных наборах. LastOPD сравнивали с токенной дистилляцией, OPRD и вариантами, где скрытая цель работала постоянно.
Прирост сохранился с обоими учителями и на большинстве отложенных наборов. LastOPD также достигал конечного результата токенной дистилляции примерно вдвое быстрее. Продлённый запуск удерживал результат после отключения скрытой цели, тогда как OPRD с постоянным выравниванием не восстановился.
Для команд с уже работающей дистилляцией это не требует менять архитектуру ученика на этапе вывода. Изменения относятся к постобучению: нужно получать последнее скрытое состояние учителя, добавить проектор и плавно выключить новую цель в начале запуска.
Работа даёт основание проверить короткий скрытый разгон рядом с текущим токенным обучением, особенно когда учитель и ученик отличаются глубиной и шириной. Переносить конкретное расписание без проверки рано: основные замеры сделаны на моделях Qwen с общими словарём и разбиением текста на токены, преимущественно на математических задачах.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



