Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Дистилляцию LLM научились теоретически защищать от систематических ошибок модели-учителя, даже когда ответы в целевой области нельзя проверять. В работе Haichen Hu, Yuheng Zhang и David Simchi-Levi, которая не прошла рецензирование и где числа получили сами авторы, алгоритм CCL сводит расхождение с лучшим доступным студентом к нулю, тогда как прямое копирование учителя может сохранять ошибку. Для разработки продукта это пока схема нового контура обучения, а не готовая замена обычной дистилляции.
CCL связывает калибровку учителя и обучение студента. На каждой итерации алгоритм уточняет учителя по исходным вопросам, где доступна надёжная оценка ответов, а затем использует его для обучения студента на целевых вопросах без такой оценки. Обновлённый студент влияет на следующую калибровку, поэтому учитель не остаётся неподвижным источником синтетических данных.
Обучение работает с развилками на уровне отдельных токенов и сравнивает продолжения ответа. Доказательство показывает, что среднее расхождение Кульбака — Лейблера между распределениями ответов CCL и эталонного студента убывает с полиномиальной скоростью по числу итераций. Эталоном служит не неограниченно лучшая модель, а лучший вариант внутри выбранного класса студентов с ограничением на отклонение от исходной модели.
Для прямой дистилляции авторы построили случай, где учитель получает более высокую целевую награду, чем любой доступный студент, но обученный копированием студент всё равно остаётся на ненулевом расстоянии от оптимального представителя своего класса. Сильный учитель сам по себе, таким образом, не гарантирует правильного переноса: его систематическая ошибка может конфликтовать с ограничениями меньшей модели.
Результат доказан для авторегрессионной модели с конечной длиной ответа, линейными softmax-политиками, фиксированными наборами исходных и целевых вопросов и точной проверкой исходных ответов. Разделение с прямым копированием показано на сконструированной задаче модели-оценщика; эксперименты с предобученными LLM в работу не входят. Поэтому CCL пока стоит рассматривать как основание для прототипа, если проверка доступна только в исходной области, а распределение рабочих запросов от неё отличается.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



