Журнал · Rit.work

LayerRoute ускорил Qwen2.5-0.5B на 4% пропуском слоёв

LayerRoute выбирает, какие слои Qwen2.5-0.5B запускать для каждого запроса, и сокращает задержку без ухудшения оценки качества текста.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Qwen2.5-0.5B-Instruct научили выполнять разные запросы через разное число слоёв. В препринте, который не проходил рецензирование и приводит числа самого автора, вывод работал в среднем в 1,04 раза быстрее без ухудшения оценки вероятности текста. Для продуктовой команды это скорее приём дополнительной оптимизации, чем основание менять выбранную архитектуру.

Метод LayerRoute добавляет маршрутизатор к каждому из 24 блоков модели. Он принимает жёсткое решение: запустить блок или передать его вход дальше без вычислений. Маршрутизаторы обучают вместе с LoRA — небольшими добавками к весам внимания, поэтому модель приспосабливается к пропуску слоёв, а не теряет их после обучения.

Во всех десяти запусках доступными для пропуска стали одни и те же девять средних слоёв. Ускорение составляло от 1,02 до 1,06 раза относительно той же модели с теми же LoRA, но с принудительно включёнными блоками. Замеряли реальное время последовательной генерации токенов: при закрытом маршруте блок не вычислялся, а не запускался с последующим отбрасыванием результата.

Перплексия — мера того, насколько уверенно модель предсказывает продолжение текста, — снизилась примерно на 1,1 пункта на обеих оценочных частях. В одном показательном запуске входные данные меняли решение маршрутизатора для медианных 93% примеров в пропускаемых слоях. Значит, LayerRoute не свёлся к заранее зафиксированной обрезке модели.

Проверка охватывает только Qwen2.5-0.5B-Instruct и смесь данных с вызовами инструментов, рассуждениями и планированием. На каждом запуске оценивали по 100 отложенных примеров, а базой служила полная модель с теми же донастроенными весами. Результат подтверждает небольшой выигрыш задержки в этой конфигурации, но не показывает, сохранится ли он на более крупных моделях и в других архитектурах.

Источники

Иллюстрация: рисунок из статьи «LayerRoute: Adaptive Layer-Skipping with LoRA-Preserved Quality for Efficient LLM Inference», Prateek Kumar Sikdar, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу