Журнал · Rit.work

AIM-ZO сохраняет полезные направления между прямыми проходами LLM

AIM-ZO поддерживает широкое подпространство по активациям модели, но на каждом шаге использует только его часть, повышая точность дообучения без обратного распространения.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Дообучать большие языковые модели только прямыми проходами удалось точнее, если сохранять найденные по активациям направления между шагами. В нерецензированном препринте, где все числа получены самими авторами, команда университетов и Huawei показывает: AIM-ZO обошёл MeZO на OPT-30B в среднем на 2,85 процентного пункта при одинаковом бюджете прямых проходов. Для команд с жёстким ограничением памяти это делает дообучение без обратного распространения более практичным вариантом.

Активации подсказывают, куда менять веса

Оптимизация нулевого порядка (zeroth-order optimization) не вычисляет градиент через обратное распространение. Вместо этого алгоритм немного возмущает веса, запускает модель, смотрит на изменение функции потерь и по нему оценивает направление следующего шага.

Такой подход расходует память примерно как логический вывод модели, потому что ему не нужно хранить все промежуточные значения для обратного прохода. Проблема переходит из памяти в качество сигнала: случайное возмущение среди миллиардов параметров часто почти не совпадает с направлением, которое действительно уменьшает ошибку.

AIM-ZO ищет более полезные направления по активациям — промежуточным значениям, которые поступают на вход линейных слоёв. Градиент весов такого слоя связан с пространством его входных активаций, поэтому последние дают ориентир даже без вычисления самого градиента.

На каждом шаге метод выполняет прямой проход без возмущения и обновляет для каждого слоя ортонормированный базис. Для этого применяется правило Oja: оно постепенно выделяет устойчивые направления в потоке активаций. Базис переносится на следующий шаг, поэтому случайные особенности одной мини-выборки не стирают структуру, накопленную раньше.

Это отличает AIM-ZO от AGZO, который заново строит подпространство по текущей мини-выборке, и от ZO-Act с зафиксированным начальным подпространством. Первый вариант не накапливает историю, второй не следует за изменениями представлений во время обучения.

Широкий базис не обязан целиком участвовать в каждом шаге

Широкое подпространство охватывает больше потенциально полезных направлений, но ухудшает оценку, если активировать его целиком. Ограниченного числа прямых проходов недостаточно, чтобы надёжно измерить вклад каждого направления.

AIM-ZO разделяет хранимую и активную ширину. Метод поддерживает широкий базис, а для отдельного возмущения берёт только небольшую часть: несколько ведущих направлений остаются общими, остальные случайно выбираются из сохранённого пула. Следующее возмущение получает другой набор и исследует другую часть того же пространства.

Так алгоритм сохраняет широкий охват, не увеличивая размер каждой оценки. Анализ в работе связывает преимущество с долей градиента, которую удерживает активная часть: если она сохраняет достаточно сигнала, её оценка лучше совпадает с настоящим градиентом, чем оценка по всему широкому базису.

Потери для разных возмущений измеряются на одной мини-выборке и сравниваются со средним результатом всей группы. Это позволяет использовать односторонние возмущения: каждый дополнительный прямой проход проверяет новое направление, а не вторую сторону уже выбранного. Отдельный проход без возмущения нужен для обновления базиса, а не для обратного распространения.

Метод проверяли на пяти моделях семейств OPT и Qwen3 — от 600 млн до 30 млрд параметров — и одиннадцати задачах классификации и ответов на вопросы. Бюджеты прямых проходов у сравниваемых методов совпадали, поэтому выигрыш нельзя объяснить дополнительными оценками функции потерь.

Когда AIM-ZO меняет план разработки

На OPT-2.7B метод превысил средний результат сильнейшего полностью проверенного конкурента на 1,26 процентного пункта. На Qwen3-8B преимущество над MeZO сократилось до 0,93 пункта, причём на одной из задач результат ухудшился. Эффект зависит от семейства модели и набора данных, поэтому переносить выигрыш с OPT на другую архитектуру без пилотного запуска не стоит.

Вывод работы относится прежде всего к выбору среди методов нулевого порядка. Эксперименты сравнивают AIM-ZO с MeZO, AGZO, LoZO, ZO-Muon и другими способами строить возмущения, а не доказывают превосходство над обычным дообучением с обратным распространением.

Если модель и состояния оптимизатора помещаются в доступную память, работа сама по себе не даёт причины отказываться от градиентного обучения. AIM-ZO становится кандидатом, когда обратный проход не помещается, а простое случайное возмущение даёт слишком слабый сигнал.

За улучшение приходится хранить базисы слоёв, обновлять их и собирать входные активации во время центрального прохода. На измеренной конфигурации дополнительный пик памяти относительно MeZO составил 0,242–0,254 GiB и остался ниже, чем у AGZO и полнопараметрического SGD. Подход также требует доступа к весам и активациям линейных слоёв: API, который возвращает только готовый ответ или итоговую функцию потерь, недостаточно.

Практический следующий шаг — сравнить AIM-ZO с уже используемым вариантом MeZO на целевой модели при одном бюджете проходов. Код метода открыт, а основные точки проверки понятны: качество на нужной задаче, память под базисы и время обновления подпространства.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу