Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Скорость обучения LLM можно подстраивать по ходу предобучения, не отказываясь от заранее заданного графика. В пока не рецензированной работе Peking University и Nanjing University, где все числа получили сами авторы, SOLAR на верхнем проверенном размере плотной модели снизил итоговую перплексию более чем на 10% против AdamW с Cosine. Такой контроллер можно добавить поверх существующего оптимизатора, не меняя его правило обновления весов.
Как SOLAR меняет базовый график, не переписывая его
Обычный график заранее задаёт разогрев, рабочую фазу и снижение скорости обучения. Он остаётся неизменным, даже если потери перестали снижаться, нормы градиентов выросли или разные части модели начали вести себя по-разному.
SOLAR сохраняет этот график как опорный. Контроллер не предсказывает скорость обучения целиком, а выдаёт ограниченную поправку для каждой группы параметров. На каждом шаге поправка применяется к текущему значению базового графика, поэтому одна неудачная команда не меняет все последующие шаги.
В плотных моделях отдельной группой служит обучаемый тензор, а в MoE-моделях группы соответствуют модулям, которые выделяет реализация. Это позволяет, например, менять шаг для эмбеддингов иначе, чем для внутренних проекций внимания и многослойных блоков.
Контроллер получает компактное описание состояния. Общая часть включает ход обучения, текущую потерю, её колебания и расхождение короткого и длинного трендов. Для конкретной группы добавляются базовая скорость обучения, нормы градиентов и параметров, предыдущее действие, глубина слоя и недавнее изменение градиента.
Действия выбирает небольшая нейросеть, которую обучает PPO — алгоритм обучения с подкреплением. Награда учитывает немедленное снижение потери, более длинный тренд и устойчивость градиентов внутри группы. SOLAR использует значения из обычного цикла обучения и не требует дополнительного прямого или обратного прохода модели.
Почему привязка и границы удерживают обучение
В сопоставимом контрольном опыте глобальный PPO-контроллер, который рекурсивно менял собственный график, закончил с перплексией (PPL) 27,09 — чем она ниже, тем лучше модель предсказывает следующий токен. Привязка к базовому графику и ограничение действий снизили результат до 23,74, а отдельные поправки для групп параметров — до 22,87.
Разница показывает, что пользу даёт не просто автоматический выбор скорости. Контроллеру помогает узкая зона ответственности: базовый график задаёт общую форму обучения, а политика корректирует её по текущему состоянию. Воспроизвести результат одним усреднённым графиком или постоянным набором коэффициентов для модулей не удалось.
На Qwen2-MoE итоговая перплексия снизилась с 9,61 до 9,34. Во время обучения SOLAR назначал более крупные множители компонентам, связанным со словарём, и сильнее ограничивал внутренние проекции, но зависимость между нормой градиента и скоростью различалась по типам модулей. Значит, контроллер не свёл решение к единому правилу вроде «больше градиент — меньше шаг».
Отдельный Circuit-Breaker следит за резким скачком потери. Если порог превышен, он останавливает текущую последовательность действий, обновляет контроллер на полученном сигнале и возвращает модель с оптимизатором к последней безопасной контрольной точке. Состояние PPO при этом сохраняется, чтобы опасное действие повлияло на дальнейшую политику.
Когда SOLAR стоит включать в план обучения
Проверка охватывает плотные Llama 2 от 60M до 1B параметров на C4, оптимизаторы AdamW и Muon, а также MoE-конфигурации на The Pile вплоть до 3B. В работу входят Qwen2-MoE и дополнительный запуск DeepSeek-V2. Это достаточно широкий набор для технического испытания, но не подтверждение поведения на более крупных промышленных обучениях.
Ближайший практический сценарий — оставить настроенный Cosine или другой базовый график и проверить SOLAR как ограниченный слой управления поверх него. Для этого инфраструктура должна хранить признаки по группам параметров, выполнять контроллер, обновлять PPO и уметь полностью восстанавливать модель и оптимизатор из контрольной точки.
Есть и менее рискованный режим. Политику можно обучить на самой малой прокси-модели, заморозить и перенести на более крупные плотные модели без обновлений PPO на целевом запуске. Такой перенос работал в четырёхкратном диапазоне базовой скорости обучения, поэтому команде не обязательно обучать контроллер внутри каждого дорогого запуска.
SOLAR пока не отменяет подбор базового графика: именно он задаёт разогрев и снижение, а контроллер исправляет локальные отклонения. Работа меняет план экспериментов, если команда уже предобучает собственную LLM и стоимость неудачного графика высока. Для использования по умолчанию на масштабах выше проверенных сначала нужен отдельный контрольный прогон с тем же набором данных, оптимизатором и механизмом восстановления.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



