Журнал · Rit.work

Питание GPU можно сокращать с меньшей потерей скорости обучения LLM

Emerald AI предложила измерять чувствительность обучения LLM к питанию GPU и учитывать её при распределении общего лимита мощности кластера.

Rit.work
Студия разработки
12 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Ограничение питания GPU можно распределять между заданиями обучения LLM так, чтобы кластер терял меньше производительности. В препринте Emerald AI, который не прошёл рецензирование и содержит замеры самих авторов, такой подход при сокращении мощности на 30% вернул около 1,5 тысячи токенов в секунду на задание по сравнению с равным ограничением. Это позволяет планировать кластер не только по числу GPU, но и по тому, какие задания легче переносят дефицит питания.

Для сравнения заданий ввели Power Flexibility Index, или PFI. Он показывает соотношение между снижением потребляемой мощности и потерей пропускной способности: чем выше индекс, тем больше питания можно убрать при меньшем падении числа обработанных токенов в секунду. В экспериментах PFI менялся от 1,10 до 2,67, поэтому одинаковый лимит мощности по-разному влиял даже на задания с близким исходным потреблением.

PFI не обязательно вычислять отдельным прогоном при нескольких лимитах. Его оценивали во время работы по телеметрии NVIDIA DCGM, прежде всего по активности памяти. H200 при ограничении питания снижает частоту вычислительных блоков, но почти не меняет частоту памяти, поэтому задания, которые сильнее упираются в пропускную способность памяти, сохраняют больше скорости. Это даёт планировщику практическое правило: сильнее ограничивать гибкие задания и защищать те, у которых вычислительная производительность падает быстрее.

Метод проверяли на 131 запуске четырёх открытых моделей: плотных и со смесью экспертов, при предварительном обучении и дообучении LoRA, на кластерах до 32 H200. Дополнительная проверка на H100 была ограниченной, а сам PFI зависит от поколения ускорителя, поэтому значения между разными GPU напрямую сравнивать нельзя. Распределение мощности проверяли в симуляции на тех же кривых «мощность — пропускная способность», а не в замкнутом контуре реального планировщика; в энергозатраты входили только GPU, без процессоров, сети и охлаждения.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу