Журнал · Rit.work

COPC исправляет второй источник устаревания в асинхронном обучении LLM

COPC согласует поправки для весов политики и оценки преимущества, чтобы асинхронное обучение LLM сохраняло скорость без позднего обвала качества.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

В асинхронном обучении LLM с подкреплением нашли источник ошибок, который остаётся после обычной поправки на устаревшие данные: учебный сигнал всё ещё зависит от старой версии модели. В нерецензированном препринте Fudan University, Meituan и East China Normal University, где все числа получили сами авторы, метод COPC обошёл лучшие асинхронные альтернативы на математике и поиске, сохранив ускорение шага обучения в 1,7 раза относительно синхронного PPO. Для команд это переносит настройку с одного ограничения весов на согласованную работу двух поправок.

Почему поправки весов недостаточно

Асинхронное обучение разделяет генерацию ответов и обновление модели. Пока одни GPU создают ответы, другие уже меняют параметры, поэтому оптимизатор получает траектории от более старой версии политики.

Обычно расхождение исправляют отношением вероятностей токена: сравнивают, с какой вероятностью его выбрали старая и текущая политики. Если отношение слишком велико или мало, вклад токена ограничивают либо полностью исключают из обновления. Так методы вроде SAO не дают отдельным устаревшим примерам резко сдвинуть модель.

Но вес токена — только одна часть градиента. Вторая часть — оценка преимущества, то есть оценка того, насколько выбранное действие лучше ожидаемого результата в этом состоянии. Она зависит не только от текущего токена, но и от продолжения ответа, которое сгенерировала старая политика.

Поэтому правильно взвешенный токен может получить неверный учебный сигнал. Авторы называют это устареванием оценки преимущества: поправка в целевой функции меняет вес примера, но не исправляет доход и будущие шаги, из которых рассчитали его полезность.

Теоретический разбор показывает, что две ошибки нельзя рассматривать отдельно. В смещении градиента появляется их произведение, а в разбросе обновлений неопределённость оценки преимущества умножается на квадрат веса политики. Усиление одной поправки поэтому может как помочь, так и помешать в зависимости от настройки другой.

Как COPC согласует две поправки

COPC сохраняет маскирование токенов со слишком большим расхождением политик, но отдельно пересчитывает доходы и оценки преимущества. Для этого метод взвешивает ошибки временных разностей, из которых складывается будущий доход, отношением вероятностей старой и текущей политик.

Отношение ограничивают с двух сторон. Нижняя граница не даёт почти исчезнувшим при новой политике действиям обнулить весь последующий сигнал, верхняя не позволяет редкому действию получить чрезмерный вес. Исправленные доходы служат целями для критика, а построенные из них оценки преимущества обновляют модель.

У двух каналов остаются отдельные параметры: один задаёт интервал маскирования токенов, другой — интервал для пересчёта доходов. Их подбирают совместно. В переборе параметров один и тот же переход к более слабой поправке преимущества улучшал результат при строгом маскировании политики, но ухудшал его при более свободном маскировании.

При этом удачные настройки занимали широкую область, а не одну точку. Авторы выбрали общую пару параметров и использовали её во всех основных экспериментах без отдельной настройки под каждую задачу или степень устаревания.

Когда работа меняет планы обучения

На математических задачах COPC превысил средний результат сильнейшей асинхронной альтернативы на 2,03 пункта, а на поиске — на 2,77 пункта. На поисковых задачах большинство сравнительных методов теряло качество ближе к концу обучения, тогда как COPC сохранял стабильность. Эффект удержался при задержке политики в 64 шага, а время одного шага выросло примерно на 1% относительно асинхронного PPO.

Проверку провели на Qwen3-4B-Instruct для математических рассуждений с инструментами и на Llama-3.2-3B-Instruct для поиска по документам. COPC сравнивали с PPO, DAPO, AReaL, SAO и V-trace, а также с собственной версией без пересчёта доходов. Эксперименты покрывают actor–critic обучение с проверяемыми наградами, но не показывают, как вывод переносится на более крупные модели и другие типы обратной связи.

Если генерация и оптимизация идут синхронно, работа не требует менять архитектуру обучения: там нет рассматриваемой задержки между политиками. Для асинхронного конвейера одной фильтрации устаревших токенов уже недостаточно считать полной защитой.

Практический вывод — хранить версию политики для каждой траектории, пересчитывать отношения вероятностей не только в целевой функции модели, но и при построении доходов, а параметры обоих каналов подбирать одной сеткой. Особенно это относится к системам с долгими вызовами инструментов и разной длиной ответов: именно там параллельная генерация экономит больше времени, но увеличивает разрыв между сбором данных и обновлением.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу