Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Wenhui Chen и соавторы в препринте, который не проходил рецензирование, описали разрыв между обучаемыми и развёрнутыми весами при дистилляции LLM методом Low-Rank Clone. В самом широком из проверенных вариантов модель достигла прежней точности при вдвое меньшем числе токенов дистилляции. Работа важна командам, которые сжимают LLM с наследованием весов учителя и рассчитывают стоимость будущего инференса.
Что сделали
Low-Rank Clone, или LRC, переносит знания из крупной модели-учителя в меньшую модель-ученика. Метод сокращает скрытую размерность модели, но сохраняет промежуточную ширину MLP — блока из полносвязных слоёв внутри трансформера.
Авторы утверждают, что в LRC возникает несоответствие. При инференсе ученик использует полную матрицу MLP, унаследованную по ширине от учителя. Однако параметризация обучения разрешает оптимизатору изменять её только внутри линейного подпространства, заданного весами учителя. Остальные направления входят в развёрнутую модель и требуют вычислений, но обучение не может ими воспользоваться. Речь идёт не о фиксированных нейронах или нулевых элементах, а о независимых направлениях изменения матрицы.
Для проверки авторы предложили две реализации одного принципа — обучать всю матрицу, которая затем будет развёрнута. Dense-LRC объединяет исходные параметры LRC в обычную плотную матрицу и продолжает обучать все её элементы. CORE-LRC представляет ту же матрицу в спектральном базисе весов учителя: ранее недоступные направления добавляются с нулевой инициализацией и поэтому не меняют модель в момент запуска обучения.
Обе реализации начинают с того же состояния, что и обычный LRC, а после обучения сворачиваются в одну стандартную матрицу. Форма модели, число параметров при инференсе и количество операций не меняются. При этом во время обучения оптимизируется больше координат и требуется соответствующее состояние оптимизатора. Авторы применяли изменение только к входным, управляющим и выходным проекциям MLP, сохраняя остальные части схемы LRC.
Что показали
По расчётам авторов, исходная параметризация LRC оставляет недоступными для обучения 62,5–81,4% независимых линейных степеней свободы развёрнутых матриц. Доля зависит от отношения промежуточной ширины MLP к скрытой размерности учителя.
На переходах Llama3.2-3B, Llama3.1-8B и Qwen2.5-3B к меньшим ученикам лучший вариант полной матрицы прибавил соответственно 2,36, 2,71 и 10,45 пункта Avg9 относительно LRC с сопоставимым бюджетом. Avg9 — усреднённая точность на наборе задач с выбором ответа и вопросами, измеренная без примеров в запросе.
Наибольший эффект авторы получили для Qwen с самой широкой MLP: CORE-LRC потребовалось вдвое меньше токенов, чтобы выйти на результат более длинного обучения по исходной схеме. Контроль с тем же числом обучаемых координат, но без выхода из подпространства учителя, остался в пределах погрешности обычного LRC. Это поддерживает объяснение через доступную область весов, а не только через увеличение числа обучаемых параметров.
Ограничения
Работу проверяли на трёх парах учитель–ученик и только на основе LRC. Основные запуски использовали около 10 млрд токенов дистилляции и короткое дополнительное обучение на инструкциях. Каждый запуск выполнен с одним значением начальной случайности, поэтому погрешность оценки задач не отражает возможный разброс между полноценными повторными обучениями.
Оценка ограничена задачами с выбором ответа и короткими вопросами без примеров в запросе. Работа не показывает качество генерации длинных ответов, многошаговых рассуждений и моделей MoE. Не проверено и то, возникает ли такой же резерв у других методов обрезки и дистилляции.
Самый большой результат для Qwen получен в отдельной линии обучения, а не в строго парном запуске. У авторов есть меньший, но положительный эффект в сопоставимом эксперименте; именно он лучше подходит для вывода о причине улучшения. Сравнение с официально сжатыми моделями Meta проведено при разных рецептах и отражает число токенов, а не затраты GPU. В работе также нет замеров времени обучения, пиковой памяти и полной стоимости оптимизации увеличенного набора параметров.
Что это значит
Для команд, уже использующих LRC, работа меняет план экспериментов, но не требует менять архитектуру развёртывания. Перед следующим длительным обучением имеет смысл измерить отношение доступной обучению размерности весов к размерности матриц, за которые платит инференс. Если матрица развёрнута полностью, а оптимизатор ограничен унаследованным подпространством, нужен парный тест обычного LRC и обучения полной матрицы из одинакового начального состояния.
Практическое преимущество подхода состоит в отсутствии нового формата модели: после объединения весов сервер получает ту же форму MLP и то же число операций. Это снижает риск для уже выбранного стека инференса. Однако «без дополнительной стоимости» относится только к развёрнутой модели. Бюджет обучения придётся оценивать отдельно, поскольку число оптимизируемых координат и состояние оптимизатора увеличиваются, а авторы не перевели это увеличение в стоимость GPU.
Для команд, которые ещё выбирают способ сжатия, работа не доказывает превосходство LRC над структурной обрезкой или обучением компактной модели с нуля. Она предлагает более общий аудит: либо неиспользуемая ширина удаляется и перестаёт стоить ресурсов при инференсе, либо она должна быть доступна обучению. Пересматривать продуктовую архитектуру по этим результатам рано, но оставлять полную матрицу в модели и заранее запрещать оптимизатору использовать большую её часть теперь стоит считать отдельным инженерным решением, требующим проверки.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



