Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи PayPal AI предложили XMerge — способ сокращать глубину LLM с локальным восстановлением удаляемых слоёв; работа опубликована как препринт, не проходивший рецензирования. При удалении четырёх слоёв метод занял первое место на CORE у шести из семи моделей. Результат важен командам, которым нужно снизить задержку генерации без нестандартной архитектуры и отдельных модулей на этапе эксплуатации.
Что сделали
XMerge разделяет сжатие на выбор слоя и реконструкцию его границы. Сначала метод ищет блок, который слабо меняет и величину, и направление скрытого состояния — внутреннего представления текста в модели. Затем соседний сохранившийся блок дообучается воспроизводить выход исходной пары.
Для реконструкции не нужны метки задач: целевыми значениями служат активации исходной модели на WikiText-2. После обработки получается обычный трансформер с меньшим количеством слоёв, без новых параметров и изменений API.
По замерам авторов, основной вклад даёт именно реконструкция. Простое удаление выбранного слоя уступало сравниваемым методам, а объединение двух критериев выбора помогало лишь тогда, когда они указывали на разные блоки. На CORE — совокупной оценке по 22 задачам — три крупнейших преимущества XMerge были статистически значимы, остальные различия укладывались в погрешность.
Что это значит
Метод меняет компромисс между подготовкой и эксплуатацией модели. XMerge требует дополнительного локального обучения при сборке, зато обслуживается как стандартная укороченная LLM. При наиболее агрессивном варианте среднее ускорение генерации составило 1,17 раза и не зависело от способа удаления слоёв, поэтому различие между методами сводится к сохранённому качеству.
Ограничения. Авторы проверили XMerge на семи базовых decoder-only моделях Llama и Qwen размером от 0,5B до 8B параметров и сравнили с пятью опубликованными подходами. Работа не показывает переносимость на MoE, мультимодальные и encoder–decoder-модели, а также на поведение безопасности. Использован один запуск сжатия, WikiText-2 одновременно служил материалом для реконструкции и источником теста перплексии, поэтому эта метрика частично внутридоменная. В основном сравнении не уравнивались вычислительные затраты на построение модели: XMerge выполняет градиентную оптимизацию, которой нет у некоторых базовых методов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



