Журнал · Rit.work

LOO-ROLL сокращает число прогонов при обучении LLM без обратного распространения

Разбор искажений в EGGROLL и нового оценщика LOO-ROLL, который использует один прогон на направление и выигрывает за счёт большего числа шагов обучения.

Rit.work
Студия разработки
11 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Один прогон модели на каждое случайное изменение весов может дать лучший результат, чем два симметричных прогона. В препринте Ege C. Kaya и Abolfazl Hashemi, который не прошёл рецензирование и содержит замеры самих авторов, LOO-ROLL улучшил результат в семи из десяти сценариев при одинаковом времени обучения. Для команд, которые дообучают LLM без обратного распространения, это повод пересмотреть не способ возмущать веса, а распределение бюджета между прогонами.

Почему возмущения ранга один вообще работают

Эволюционные стратегии оптимизируют модель по значению целевой функции: меняют веса, запускают прямой проход и смотрят, стало ли лучше. Они не вычисляют градиенты через обратное распространение, поэтому требуют меньше памяти, но должны проверить много вариантов весов.

Плотное случайное изменение матрицы размером m × n приходится хранить и применять отдельно для каждого участника популяции. EGGROLL заменяет его произведением двух узких случайных матриц. Дополнительные вычисления и память тогда растут пропорционально сумме сторон матрицы, а не числу всех её элементов.

Самый дешёвый вариант использует возмущение ранга один. У его элементов такая же дисперсия, как у плотного гауссовского возмущения, а разные элементы не коррелируют. Но этого недостаточно, чтобы два метода двигались в одном направлении: каждая отдельная матрица ранга один принадлежит узкому подмножеству всех возможных матриц.

Работа разделяет два эффекта. Случайные изменения сначала сглаживают целевую функцию, а затем EGGROLL дополнительно фильтрует её градиент из-за несоответствия между распределением возмущений и способом вычислять оценку. Получившееся поле обновлений не всегда можно представить как градиент какой-либо скалярной функции. В построенном авторами примере локальный оптимум даже становится отталкивающей точкой.

На квадратичных функциях искажение исчезает полностью. Для гладких функций первая поправка уменьшается пропорционально квадрату радиуса возмущения и обратно пропорционально рангу. Практический смысл прост: ранг один безопаснее там, где функция около текущих весов похожа на квадратичную и изменения достаточно малы.

Низкий ранг при этом почти не ухудшает точность выборочной оценки собственного направления EGGROLL. Для квадратной матрицы со стороной 4096 дополнительная дисперсия при ранге один составляет 0,098% относительно плотного гауссовского метода. Узкое пространство отдельных возмущений поэтому не означает, что для оценки среднего обязательно нужна намного большая популяция.

LOO-ROLL тратит один прогон вместо симметричной пары

Практическая реализация EGGROLL проверяет каждое направление дважды: прибавляет возмущение к весам, затем вычитает его и сравнивает результаты. Такая симметричная пара убирает общую сложность примеров и чётче выделяет эффект изменения весов, но удваивает число прямых проходов.

LOO-ROLL проверяет каждое направление один раз. В качестве базового уровня он берёт средний результат остальных участников популяции и вычитает его из результата текущего участника. До стандартизации оценок этот приём сохраняет то же ожидаемое поле обновлений, что и EGGROLL.

При одинаковом числе прогонов освободившийся бюджет позволяет проверить вдвое больше независимых направлений. В измерениях на блоках трансформера это примерно вдвое снизило среднюю квадратичную ошибку оценки. Однако в полных запусках при одинаковом числе вычислений различия оставались в пределах погрешности.

Выигрыш проявился, когда сравнение ограничили фактическим временем: LOO-ROLL успевал сделать больше шагов. На Qwen3-0.6B точность на GSM8K выросла с 38,1% до 63,0%. Все семь статистически различимых результатов оказались в пользу LOO-ROLL, а значимых проигрышей не было.

Менять стоит оценщик, а не ранг возмущений

Если команда уже использует EGGROLL или близкую эволюционную схему, LOO-ROLL выглядит как локальная замена оценщика. Он сохраняет низкоранговые возмущения, пакетную обработку популяции и требования к памяти, но иначе расходует прямые проходы. Проверять его нужно при одинаковом времени, а не только при одинаковом числе обновлений.

Повышать ранг ради более точного направления работа не советует. Сравнения не обнаружили воспроизводимого преимущества ранга восемь по награде, а дополнительные вычисления сокращали число шагов, доступных за тот же срок. Сначала разумнее уменьшить радиус возмущений и проверить LOO-ROLL, чем расширять случайные матрицы.

Эффект зависит от размера популяции. При малом числе направлений базовый уровень, рассчитанный по остальным участникам, остаётся шумным. Экономия начинает приносить пользу, когда её можно потратить на дополнительные направления или шаги, поэтому тест должен повторять реальный размер пакета и ограничения оборудования.

Эксперименты охватывают Qwen3 и SmolLM2, задачи с наградой и предсказание следующего токена, а крупнейшая модель содержит 8B параметров. Теоретическое сравнение дисперсии опирается на локально линейную модель, а точное сохранение поля LOO-ROLL доказано до стандартизации оценок. Эти границы делают метод кандидатом для сравнительного запуска, но не универсальной заменой без проверки на целевой функции продукта.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу