Журнал · Rit.work

SOLAR подстраивает скорость обучения LLM во время предобучения

SOLAR корректирует базовый график скорости обучения по состоянию модели, ограничивает риск неудачных действий и переносится между масштабами.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Скорость обучения LLM можно подстраивать по ходу предобучения, не отказываясь от заранее заданного графика. В пока не рецензированной работе Peking University и Nanjing University, где все числа получили сами авторы, SOLAR на верхнем проверенном размере плотной модели снизил итоговую перплексию более чем на 10% против AdamW с Cosine. Такой контроллер можно добавить поверх существующего оптимизатора, не меняя его правило обновления весов.

Как SOLAR меняет базовый график, не переписывая его

Обычный график заранее задаёт разогрев, рабочую фазу и снижение скорости обучения. Он остаётся неизменным, даже если потери перестали снижаться, нормы градиентов выросли или разные части модели начали вести себя по-разному.

SOLAR сохраняет этот график как опорный. Контроллер не предсказывает скорость обучения целиком, а выдаёт ограниченную поправку для каждой группы параметров. На каждом шаге поправка применяется к текущему значению базового графика, поэтому одна неудачная команда не меняет все последующие шаги.

В плотных моделях отдельной группой служит обучаемый тензор, а в MoE-моделях группы соответствуют модулям, которые выделяет реализация. Это позволяет, например, менять шаг для эмбеддингов иначе, чем для внутренних проекций внимания и многослойных блоков.

Контроллер получает компактное описание состояния. Общая часть включает ход обучения, текущую потерю, её колебания и расхождение короткого и длинного трендов. Для конкретной группы добавляются базовая скорость обучения, нормы градиентов и параметров, предыдущее действие, глубина слоя и недавнее изменение градиента.

Действия выбирает небольшая нейросеть, которую обучает PPO — алгоритм обучения с подкреплением. Награда учитывает немедленное снижение потери, более длинный тренд и устойчивость градиентов внутри группы. SOLAR использует значения из обычного цикла обучения и не требует дополнительного прямого или обратного прохода модели.

Почему привязка и границы удерживают обучение

В сопоставимом контрольном опыте глобальный PPO-контроллер, который рекурсивно менял собственный график, закончил с перплексией (PPL) 27,09 — чем она ниже, тем лучше модель предсказывает следующий токен. Привязка к базовому графику и ограничение действий снизили результат до 23,74, а отдельные поправки для групп параметров — до 22,87.

Разница показывает, что пользу даёт не просто автоматический выбор скорости. Контроллеру помогает узкая зона ответственности: базовый график задаёт общую форму обучения, а политика корректирует её по текущему состоянию. Воспроизвести результат одним усреднённым графиком или постоянным набором коэффициентов для модулей не удалось.

На Qwen2-MoE итоговая перплексия снизилась с 9,61 до 9,34. Во время обучения SOLAR назначал более крупные множители компонентам, связанным со словарём, и сильнее ограничивал внутренние проекции, но зависимость между нормой градиента и скоростью различалась по типам модулей. Значит, контроллер не свёл решение к единому правилу вроде «больше градиент — меньше шаг».

Отдельный Circuit-Breaker следит за резким скачком потери. Если порог превышен, он останавливает текущую последовательность действий, обновляет контроллер на полученном сигнале и возвращает модель с оптимизатором к последней безопасной контрольной точке. Состояние PPO при этом сохраняется, чтобы опасное действие повлияло на дальнейшую политику.

Когда SOLAR стоит включать в план обучения

Проверка охватывает плотные Llama 2 от 60M до 1B параметров на C4, оптимизаторы AdamW и Muon, а также MoE-конфигурации на The Pile вплоть до 3B. В работу входят Qwen2-MoE и дополнительный запуск DeepSeek-V2. Это достаточно широкий набор для технического испытания, но не подтверждение поведения на более крупных промышленных обучениях.

Ближайший практический сценарий — оставить настроенный Cosine или другой базовый график и проверить SOLAR как ограниченный слой управления поверх него. Для этого инфраструктура должна хранить признаки по группам параметров, выполнять контроллер, обновлять PPO и уметь полностью восстанавливать модель и оптимизатор из контрольной точки.

Есть и менее рискованный режим. Политику можно обучить на самой малой прокси-модели, заморозить и перенести на более крупные плотные модели без обновлений PPO на целевом запуске. Такой перенос работал в четырёхкратном диапазоне базовой скорости обучения, поэтому команде не обязательно обучать контроллер внутри каждого дорогого запуска.

SOLAR пока не отменяет подбор базового графика: именно он задаёт разогрев и снижение, а контроллер исправляет локальные отклонения. Работа меняет план экспериментов, если команда уже предобучает собственную LLM и стоимость неудачного графика высока. Для использования по умолчанию на масштабах выше проверенных сначала нужен отдельный контрольный прогон с тем же набором данных, оптимизатором и механизмом восстановления.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу