Журнал · Rit.work

XMerge: слой LLM лучше реконструировать, чем просто удалить

Метод PayPal AI сокращает глубину Llama и Qwen без изменения архитектуры, сохраняя качество стабильнее пяти способов удаления и объединения слоёв.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи PayPal AI предложили XMerge — способ сокращать глубину LLM с локальным восстановлением удаляемых слоёв; работа опубликована как препринт, не проходивший рецензирования. При удалении четырёх слоёв метод занял первое место на CORE у шести из семи моделей. Результат важен командам, которым нужно снизить задержку генерации без нестандартной архитектуры и отдельных модулей на этапе эксплуатации.

Что сделали

XMerge разделяет сжатие на выбор слоя и реконструкцию его границы. Сначала метод ищет блок, который слабо меняет и величину, и направление скрытого состояния — внутреннего представления текста в модели. Затем соседний сохранившийся блок дообучается воспроизводить выход исходной пары.

Для реконструкции не нужны метки задач: целевыми значениями служат активации исходной модели на WikiText-2. После обработки получается обычный трансформер с меньшим количеством слоёв, без новых параметров и изменений API.

По замерам авторов, основной вклад даёт именно реконструкция. Простое удаление выбранного слоя уступало сравниваемым методам, а объединение двух критериев выбора помогало лишь тогда, когда они указывали на разные блоки. На CORE — совокупной оценке по 22 задачам — три крупнейших преимущества XMerge были статистически значимы, остальные различия укладывались в погрешность.

Что это значит

Метод меняет компромисс между подготовкой и эксплуатацией модели. XMerge требует дополнительного локального обучения при сборке, зато обслуживается как стандартная укороченная LLM. При наиболее агрессивном варианте среднее ускорение генерации составило 1,17 раза и не зависело от способа удаления слоёв, поэтому различие между методами сводится к сохранённому качеству.

Ограничения. Авторы проверили XMerge на семи базовых decoder-only моделях Llama и Qwen размером от 0,5B до 8B параметров и сравнили с пятью опубликованными подходами. Работа не показывает переносимость на MoE, мультимодальные и encoder–decoder-модели, а также на поведение безопасности. Использован один запуск сжатия, WikiText-2 одновременно служил материалом для реконструкции и источником теста перплексии, поэтому эта метрика частично внутридоменная. В основном сравнении не уравнивались вычислительные затраты на построение модели: XMerge выполняет градиентную оптимизацию, которой нет у некоторых базовых методов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу