Журнал · Rit.work

LeanStream сокращает память и ускоряет локальный запуск LLM

LeanStream уточняет загрузку весов по частичным результатам GPU и в замерах авторов ускоряет генерацию локальных LLM при меньшем расходе оперативной памяти.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Renyuan Liu, Yuyang Leng, Kaiyan Liu и соавторы представили LeanStream — систему локального запуска LLM на мобильных и встраиваемых устройствах; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, LeanStream генерирует токены в 1,6–2,1 раза быстрее предыдущих систем локального вывода. Результат важен командам, которым нужно запускать модель на устройстве, но её веса не помещаются в доступную оперативную память.

Что сделали

LeanStream рассчитан на модели с разреженными активациями: при генерации очередного токена вычисления используют только часть нейронов и связанных с ними весов. Полный набор весов хранится на SSD или во флеш-памяти, а нужные фрагменты загружаются в оперативную память по запросу.

У такого подхода есть конфликт между точностью решения и скоростью загрузки. Если дождаться результата текущего слоя, можно точнее определить веса для следующего, но операции GPU и накопителя пойдут последовательно. Если предсказать веса заранее, ввод-вывод можно совместить с вычислениями, однако ошибочный прогноз приводит к лишним загрузкам и вычислениям.

LeanStream заменяет однократный прогноз последовательностью уточнений. Система сначала выбирает наиболее вероятные фрагменты весов по доступному контексту. Пока GPU частями обрабатывает текущий полносвязный блок MLP, промежуточные результаты передаются на CPU. Планировщик пересчитывает приоритеты загрузки, выполнения и сохранения весов в кэше, не дожидаясь завершения всего слоя.

Высокоприоритетные фрагменты обрабатываются первыми. Поэтому ранние частичные результаты содержат больше информации для прогноза следующего слоя, а уже отправленные запросы к накопителю можно дополнить или изменить. GPU, в свою очередь, начинает вычисления сразу после появления подходящего блока весов, а не после загрузки всего разреженного набора.

Для обмена между CPU, GPU и подсистемой ввода-вывода авторы разработали собственный механизм синхронизации. Частота согласования выбирается во время выполнения: редкие обновления ухудшают прогноз, а слишком частые уменьшают параллелизм и добавляют накладные расходы.

Прогноз выполняет компактная модель на основе обучаемого хеширования. Вместо нескольких полносвязных слоёв она использует битовые операции и обращения к таблицам, чтобы не превращать работу планировщика в новый источник задержки.

Что показали

При производительности на уровне лучших результатов предыдущих систем LeanStream, по данным авторов, требует в 4,8–7,5 раза меньше памяти. Это сравнение учитывает не только рабочие данные модели, но и кэш весов вместе с механизмом прогнозирования.

На нагрузке Qasper с Jetson AGX Orin динамический планировщик достиг производительности 16,4 токена в секунду для Mistral, тогда как лучший статический план — 10,7 токена в секунду. Авторы связывают разницу с изменением промахов кэша между слоями и запросами: заранее выбранная частота синхронизации не успевает подстраиваться под фактическое время ввода-вывода.

Модель-распределитель при этом занимала около 24 МБ против максимальных 1,8 ГБ у сравниваемого нейросетевого предиктора. В отдельных опытах приоритетное управление кэшем также снижало долю промахов относительно PowerInfer-2 и стандартных политик вытеснения. По разбору компонентов авторами, именно сохранение наиболее важных весов давало наибольший вклад на мобильной платформе, где пропускная способность накопителя сильнее ограничивает генерацию.

Ограничения

Авторы проверяли LeanStream на трёх моделях примерно по семь миллиардов параметров — Mistral, Llama2 и Qwen2.5 — на Jetson AGX Orin, Jetson AGX Xavier и OnePlus 13. Среди показанных нагрузок есть Qasper и CoQA; это не демонстрирует переносимость результатов на модели другого масштаба, иные архитектуры, накопители и мобильные системы.

Эксперименты сосредоточены на последовательной генерации с разреженными активациями и выгрузкой весов на накопитель. Работа не показывает преимущества для моделей, которые полностью помещаются в оперативную память, для пакетной обработки нескольких запросов или для серверного вывода. Также из приведённых результатов нельзя оценить стоимость интеграции собственного механизма синхронизации в существующие мобильные среды выполнения.

Сравнение провели сами авторы на своём программном и аппаратном стенде. В работе нет независимого воспроизведения, а набор альтернатив ограничен выбранными системами разреженного локального вывода и политиками кэширования. Поэтому заявленные коэффициенты ускорения нельзя переносить на произвольное устройство без повторного замера.

Что это значит

Для команд, которые уже планируют хранить веса LLM во флеш-памяти и подгружать их во время генерации, работа меняет архитектурный выбор. Между последовательным точным прогнозом и ранней неточной выборкой весов появляется третий вариант: начать с предположения, а затем исправлять очередь загрузки по частичным результатам GPU.

Практический вывод шире конкретного предиктора. Планировщик локального вывода должен совместно управлять вычислениями, вводом-выводом и кэшем. Независимая оптимизация этих частей оставляет GPU без работы либо расходует память на веса, которые были загружены по устаревшему прогнозу.

Менять выбранную платформу только на основании статьи рано. LeanStream требует низкоуровневого взаимодействия CPU, GPU и накопителя, а выигрыш зависит от разреженности модели, скорости хранилища и поведения кэша. Рациональный следующий шаг для продукта — прототип на целевом устройстве с собственной моделью и характерными запросами, включая замеры задержки, памяти, энергопотребления и качества ответов.

Если веса уже помещаются в память или продукт допускает серверный вывод, работа сама по себе не даёт основания пересматривать планы. Её основной сценарий — автономная генерация на устройстве, где оперативной памяти недостаточно, а передача данных во внешнюю инфраструктуру нежелательна или невозможна.

Источники

Иллюстрация: рисунок из статьи «LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference», Renyuan Liu (Richard), Yuyang Leng (Richard), Kaiyan Liu (Richard) и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу