Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Малую языковую модель научили точнее перенимать общие знания большой модели, используя её промежуточные вычисления. KDFP обошёл другие способы дистилляции на 1,6–4,9% по девяти тестам; в работе Ryan Swift и Konstantinos Psounis из University of Southern California, которая пока не прошла рецензирование, все числа получили сами авторы. Схема подходит для собственных моделей с открытыми весами, но не для учителя, доступного только через API.
KDFP переносит не только финальный ответ модели
Дистилляция знаний обучает компактную модель-ученика повторять поведение более крупной модели-учителя. Обычный вариант сравнивает вероятности следующих токенов на выходе моделей. Этого достаточно для переноса части поведения, но такой сигнал почти не показывает ученику, как учитель пришёл к ответу.
KDFP требует полного доступа к обеим моделям. Во время обучения метод сопоставляет выходы механизма внимания, многослойного перцептрона и остаточного потока в каждом выбранном блоке трансформера. К ним добавляются распределение вероятностей на выходе и обычная ошибка предсказания правильного токена.
Слои ученика и учителя могут иметь разную ширину, поэтому их внутренние представления нельзя сравнить напрямую. KDFP обучает одну линейную матрицу, которая переводит активации ученика в пространство учителя. Она обслуживает все сопоставляемые блоки вместо отдельного преобразователя для каждого слоя.
Для сравнения выходных распределений авторы смешивают сигналы учителя и ученика в пропорции 75% к 25%. Такой вариант оказался лучше прямого копирования распределения учителя: ученик сохраняет собственную структуру вероятностей, но сильнее ориентируется на целевую модель.
Важное отличие от TED — KDFP не пытается отфильтровать якобы избыточную информацию в остаточном потоке. Метод использует уже вычисленные активации напрямую. Авторы связывают слабый результат TED с тем, что знания современных декодерных моделей распределены между слоями, поэтому обучаемые фильтры могут удалить полезный сигнал.
Меньший учитель и короткое обучение дали лучший результат
Метод проверяли в продолжающемся предварительном обучении, когда готовую модель дополнительно учат на новом корпусе, а не создают с нуля. Учеником служила Pythia с 1,4 млрд параметров, учителем — более крупная модель той же серии. Для обучения взяли 100 млн токенов из FineWeb Edu, а качество оценивали на задачах по рассуждению, знаниям и пониманию языка.
KDFP сравнили с обычной настройкой без учителя, классической дистилляцией по выходам, послойным переносом остаточного потока и TED. Он показал лучший средний результат, причём добавление сигналов внимания и многослойного перцептрона оказалось существенным: перенос только остаточного потока работал хуже.
Увеличение учителя не улучшило итоговый результат. Дополнительная настройка учителя на том же корпусе тоже не помогла, а расширение обучающей выборки снизило среднюю оценку. Возможное объяснение — ученику сложнее согласовать свои внутренние представления с учителем, когда различаются размеры скрытого пространства или распределения данных.
Эти выводы относятся к одной серии моделей и продолжающемуся обучению. Эксперименты проводили на одной GPU из-за ограничений TransformerLens; полное предварительное обучение и другие семейства LLM работа не охватывает.
Планы меняются только для команд с доступом к весам
Главный практический результат относится не к размеру готовой модели, а к временным параметрам во время дистилляции. KDFP обучал 5,2 млн параметров проектора, тогда как TED требовал почти 600 млн параметров фильтров. Сокращение на 99,1% упрощает состояние оптимизатора и хранение весов, которые после обучения не нужны.
Эта цифра не означает такое же сокращение времени или стоимости обучения. KDFP всё равно хранит больше промежуточных активаций и вычисляет для них ошибки. В работе нет замеров длительности запуска, потребления памяти или расходов на GPU, поэтому бюджет следует проверять на своей инфраструктуре.
Для команды, которая сжимает собственную LLM для локального или закрытого развёртывания, KDFP меняет план эксперимента: сначала стоит попробовать готового ученика, близкого учителю по архитектуре, одну общую проекцию и короткое продолжающееся обучение. Увеличивать учителя и объём корпуса заранее не требуется — в этих опытах оба шага не дали выигрыша.
Если учитель доступен только через API, применить KDFP нельзя: сервис не отдаёт внутренние активации. В таком случае остаются способы дистилляции по ответам и синтетическим данным. Для моделей с доступными весами KDFP выглядит как кандидат на проверку, но пока не как готовая замена существующей схеме обучения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



