Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Дообучать большие языковые модели только прямыми проходами удалось точнее, если сохранять найденные по активациям направления между шагами. В нерецензированном препринте, где все числа получены самими авторами, команда университетов и Huawei показывает: AIM-ZO обошёл MeZO на OPT-30B в среднем на 2,85 процентного пункта при одинаковом бюджете прямых проходов. Для команд с жёстким ограничением памяти это делает дообучение без обратного распространения более практичным вариантом.
Активации подсказывают, куда менять веса
Оптимизация нулевого порядка (zeroth-order optimization) не вычисляет градиент через обратное распространение. Вместо этого алгоритм немного возмущает веса, запускает модель, смотрит на изменение функции потерь и по нему оценивает направление следующего шага.
Такой подход расходует память примерно как логический вывод модели, потому что ему не нужно хранить все промежуточные значения для обратного прохода. Проблема переходит из памяти в качество сигнала: случайное возмущение среди миллиардов параметров часто почти не совпадает с направлением, которое действительно уменьшает ошибку.
AIM-ZO ищет более полезные направления по активациям — промежуточным значениям, которые поступают на вход линейных слоёв. Градиент весов такого слоя связан с пространством его входных активаций, поэтому последние дают ориентир даже без вычисления самого градиента.
На каждом шаге метод выполняет прямой проход без возмущения и обновляет для каждого слоя ортонормированный базис. Для этого применяется правило Oja: оно постепенно выделяет устойчивые направления в потоке активаций. Базис переносится на следующий шаг, поэтому случайные особенности одной мини-выборки не стирают структуру, накопленную раньше.
Это отличает AIM-ZO от AGZO, который заново строит подпространство по текущей мини-выборке, и от ZO-Act с зафиксированным начальным подпространством. Первый вариант не накапливает историю, второй не следует за изменениями представлений во время обучения.
Широкий базис не обязан целиком участвовать в каждом шаге
Широкое подпространство охватывает больше потенциально полезных направлений, но ухудшает оценку, если активировать его целиком. Ограниченного числа прямых проходов недостаточно, чтобы надёжно измерить вклад каждого направления.
AIM-ZO разделяет хранимую и активную ширину. Метод поддерживает широкий базис, а для отдельного возмущения берёт только небольшую часть: несколько ведущих направлений остаются общими, остальные случайно выбираются из сохранённого пула. Следующее возмущение получает другой набор и исследует другую часть того же пространства.
Так алгоритм сохраняет широкий охват, не увеличивая размер каждой оценки. Анализ в работе связывает преимущество с долей градиента, которую удерживает активная часть: если она сохраняет достаточно сигнала, её оценка лучше совпадает с настоящим градиентом, чем оценка по всему широкому базису.
Потери для разных возмущений измеряются на одной мини-выборке и сравниваются со средним результатом всей группы. Это позволяет использовать односторонние возмущения: каждый дополнительный прямой проход проверяет новое направление, а не вторую сторону уже выбранного. Отдельный проход без возмущения нужен для обновления базиса, а не для обратного распространения.
Метод проверяли на пяти моделях семейств OPT и Qwen3 — от 600 млн до 30 млрд параметров — и одиннадцати задачах классификации и ответов на вопросы. Бюджеты прямых проходов у сравниваемых методов совпадали, поэтому выигрыш нельзя объяснить дополнительными оценками функции потерь.
Когда AIM-ZO меняет план разработки
На OPT-2.7B метод превысил средний результат сильнейшего полностью проверенного конкурента на 1,26 процентного пункта. На Qwen3-8B преимущество над MeZO сократилось до 0,93 пункта, причём на одной из задач результат ухудшился. Эффект зависит от семейства модели и набора данных, поэтому переносить выигрыш с OPT на другую архитектуру без пилотного запуска не стоит.
Вывод работы относится прежде всего к выбору среди методов нулевого порядка. Эксперименты сравнивают AIM-ZO с MeZO, AGZO, LoZO, ZO-Muon и другими способами строить возмущения, а не доказывают превосходство над обычным дообучением с обратным распространением.
Если модель и состояния оптимизатора помещаются в доступную память, работа сама по себе не даёт причины отказываться от градиентного обучения. AIM-ZO становится кандидатом, когда обратный проход не помещается, а простое случайное возмущение даёт слишком слабый сигнал.
За улучшение приходится хранить базисы слоёв, обновлять их и собирать входные активации во время центрального прохода. На измеренной конфигурации дополнительный пик памяти относительно MeZO составил 0,242–0,254 GiB и остался ниже, чем у AGZO и полнопараметрического SGD. Подход также требует доступа к весам и активациям линейных слоёв: API, который возвращает только готовый ответ или итоговую функцию потерь, недостаточно.
Практический следующий шаг — сравнить AIM-ZO с уже используемым вариантом MeZO на целевой модели при одном бюджете проходов. Код метода открыт, а основные точки проверки понятны: качество на нужной задаче, память под базисы и время обновления подпространства.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



