Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новый регулятор снизил расход энергии локальной LLM, сохранив сопоставимое качество и целевую скорость генерации. В работе Northwestern University система PELM сократила расход максимум на 52,4%; поскольку препринт не рецензирован, числа получены самими авторами. Для локального продукта управление энергией становится частью среды выполнения модели, а не отдельной настройкой устройства.
Почему регулировать только частоту GPU недостаточно
Обычное динамическое управление напряжением и частотой (DVFS) снижает частоту процессора, когда нужно ограничить энергопотребление и нагрев. Для LLM это создаёт прямой конфликт: низкая частота экономит энергию, но замедляет выдачу токенов, а высокая ускоряет модель, но приближает тепловое ограничение и последующее падение производительности.
У генерации есть и другая переменная: сколько слоёв модели действительно нужно выполнить для очередного токена. Не каждый токен требует прохода через всю модель, поэтому одинаковую скорость можно получить при разных сочетаниях частоты и вычислительной глубины.
На Jetson AGX Orin сокращённый проход при частоте 0,6 ГГц выдавал те же 10 токенов в секунду, что и модель из 32 слоёв при 1,3 ГГц, но тратил на 50,9% меньше энергии. Частота сама по себе не показывает, какая конфигурация выгоднее: регулятору нужно видеть устройство и ход декодирования одновременно.
Как PELM меняет объём вычислений во время генерации
PELM следит за температурой, мощностью, загрузкой GPU, скоростью выдачи и долей принятых предварительных токенов. Регулятор на основе обучения с подкреплением выбирает частоту GPU, слой раннего выхода, длину предварительной последовательности и глубину её проверки. Его цель — удержать заданную скорость ниже температурного предела и потратить как можно меньше энергии.
Спекулятивное декодирование сначала быстро предлагает несколько токенов, а затем проверяет их параллельно основной моделью. PELM не загружает для этого отдельную черновую модель: предварительные токены строят промежуточные слои той же LLM. Такой вариант требует меньше памяти и позволяет регулятору менять глубину чернового прохода на ходу.
Второй программный рычаг — переменная глубина проверки. Если промежуточные представления уже дают пригодный результат, система не обязана проводить предложенные токены через все оставшиеся слои. Для более сложного фрагмента регулятор возвращает глубокую проверку, а для предсказуемого сокращает вычисления.
Переход между слоями поддерживает HQCache, который сохраняет скрытые состояния модели в выбранных точках. Благодаря этому выполнение можно продолжить с нужной глубины, а не пересчитывать предыдущие слои. Сам регулятор работает на CPU, поэтому выигрыш не съедают дополнительные вычисления на GPU.
PELM проверяли на Jetson AGX Orin и Orin Nano с моделями LLaMA размером 8B и 1B на пяти наборах задач. По сравнению с регуляторами, которые управляют главным образом частотой, скорость в лучшей конфигурации выросла на 23,1%, а качество ответов осталось сопоставимым с обычным полным проходом. Максимальная экономия энергии и максимальное ускорение относятся к лучшим конфигурациям экспериментов и не означают одинаковый выигрыш при любой нагрузке.
Когда PELM меняет планы локального продукта
Работа меняет подход команд, которые рассчитывали сначала выбрать модель, а затем отдельно настроить энергопотребление платформы. Если устройство долго генерирует текст под тепловым ограничением, среда выполнения должна управлять не только частотой, но также глубиной модели и способом декодирования. Иначе часть доступных режимов остаётся вне поля зрения аппаратного регулятора.
PELM нельзя подключить к произвольной LLM без подготовки. Для переменной глубины модель должна выдавать пригодные прогнозы на промежуточных слоях; такие контрольные точки авторы использовали в моделях семейства LLaMA с поддержкой раннего выхода. Без них остаются управление частотой и самоспекулятивное декодирование с полной проверкой, но исчезает один из главных способов сокращать вычисления.
Замеры охватывают платформы NVIDIA Jetson, неквантованные модели и несколько режимов охлаждения. Для смартфона, NPU или другого однокристального процессора потребуется заново связать регулятор с доступными частотами и датчиками, а затем проверить качество промежуточных выходов. Квантование также меняет соотношение задержки и мощности, поэтому результаты нельзя напрямую переносить на типичную мобильную сборку.
Практический вывод касается архитектуры прототипа: интерфейс управления моделью стоит проектировать рядом с интерфейсом управления устройством. Если среда выполнения умеет менять глубину, длину предварительной последовательности и частоту в одном цикле, команда сможет оптимизировать энергию под заданную скорость. Если эти решения зафиксированы в разных слоях системы, повторить подход PELM без переработки среды выполнения не получится.
Источники
Иллюстрация: рисунок из статьи «PELM: Power Efficient On-Device LLM Inference with Speculative Decoding and Dynamic Voltage Frequency Scaling», Weisi Yang, Stephen Xia, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



