Журнал · Rit.work

SURGE собирает более точную модель из истории RL без нового обучения

Промежуточные состояния одного RL-прогона можно объединить в новую модель, которая отвечает точнее и короче, не меняя вычисления при запуске.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Завершённый прогон обучения с подкреплением можно повторно использовать, чтобы собрать модель сильнее любого сохранённого состояния, не продолжая обучение и не увеличивая вычисления на запрос. В препринте Bangji Yang и коллег, который не прошёл рецензирование и приводит числа из замеров самих авторов, метод SURGE обошёл лучшие измеренные контрольные точки и отвечал короче опорных моделей. Для команды это добавляет промежуточный шаг между выбором лучшего состояния и запуском следующего дорогого обучения.

Контрольные точки стали деталями для новой модели

Обычно команда воспринимает историю RL как ряд готовых кандидатов: измеряет качество каждого состояния и выбирает лучшее. SURGE рассматривает ту же историю как набор изменений весов, части которых можно сочетать иначе, чем это сделал оптимизатор.

Метод берёт два состояния из одного прогона с общей начальной моделью. Опорным становится состояние с высокой точностью, донором — конкурентоспособное состояние, которое в среднем генерирует более короткие ответы. Временной порядок не имеет значения: донор может находиться как раньше, так и позже опорной точки.

Сначала из весов обоих состояний вычитают начальные веса RL. Это отделяет изменения, внесённые обучением с подкреплением, от структуры исходной модели. Затем обновление опорного состояния раскладывают на спектральные компоненты с помощью сингулярного разложения.

SURGE сохраняет ведущий блок обновления опорной модели, а оставшуюся часть берёт у донора. Это не усреднение весов и не линейное движение между двумя состояниями: результат может оказаться в области параметров, которую оптимизатор вообще не посещал.

Размер защищённого блока выбирают по заранее заданной доле сохранённой энергии обновления. После того как команда выбрала пару состояний, настройка использует только веса и не требует перебора кандидатов по качеству. При этом сам выбор опорной модели и донора по-прежнему опирается на уже измеренные точность и длину ответов.

Метод меняет матрицы внимания и полносвязных слоёв, а остальные параметры копирует из опорного состояния. На выходе получается обычная модель той же архитектуры, а не ансамбль: при запуске она выполняет один проход по одной политике.

Рост точности не свёлся к более коротким ответам

Проверка охватила две математические истории моделей на 1,5 млрд параметров и одну историю модели для кода на 7 млрд. Математическую часть оценивали на девяти наборах задач, кодовую — на HumanEval+ и MBPP+. Для ключевых сравнений SURGE сопоставили с 19 сохранёнными состояниями, а точность считали по четырём отдельным ответам на задачу.

У DeepSeek средняя точность выросла на 2,08 процентного пункта, а ответы сократились на 5,3%. У Nemotron прирост составил 1,78 пункта при сокращении ответов на 12,8%. На OLMo результат HumanEval+ превысил лучшую контрольную точку на 0,9 пункта; на MBPP+ объединённая модель совпала с опорной по точности и использовала меньше токенов.

На математических задачах SURGE улучшил точность почти везде, но один набор у Nemotron дал небольшое ухудшение. Это не независимые повторы полного обучения: работа сравнивает политики внутри конкретных готовых траекторий, поэтому она показывает доступный резерв этих прогонов, а не гарантированный выигрыш для любой пары состояний.

Контрольные эксперименты отделили эффект структуры обновлений от простого сокращения ответа. Случайные спектральные подпространства и блоки из слабых компонент тоже уменьшали число токенов, но теряли точность. Разложение абсолютных весов вместо изменений относительно начала RL также работало хуже. Значит, результат связан именно с тем, как обучение изменило модель.

В план обучения стоит добавить разбор сохранённой траектории

SURGE не отменяет следующий прогон RL, но меняет момент, когда его следует запускать. Если качество упёрлось в лучшую контрольную точку, команда может сначала проверить, не скрывает ли уже оплаченная история более удачное сочетание обновлений.

Для этого нужно сохранять начальное состояние RL, совместимые промежуточные веса и результаты оценки каждого состояния. Одних моделей из внешнего API недостаточно: метод требует прямого доступа к матрицам весов и общей точке, относительно которой вычисляют обновления.

Практический процесс выглядит так: выбрать точную опорную модель, найти донора с конкурентным качеством и более короткими ответами, собрать новую контрольную точку, затем прогнать её через тот же набор задач и тот же режим генерации. Настройка по спектру избавляет от обязательного перебора вариантов, но не от итоговой проверки качества и безопасности.

В рабочей среде вычислительный профиль не меняется: объединённая модель сохраняет архитектуру источников и не просит дополнительный бюджет рассуждения. Дополнительные расходы возникают один раз при спектральном разложении, сборке весов и оценке результата. Поэтому метод подходит как автономный этап после RL, если хранение промежуточных состояний дешевле нового обучения.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу