Журнал · Rit.work

CIS ограничивает расхождение движков при обучении LLM

CIS учитывает уверенность модели при коррекции расхождений между движками генерации и обучения, снижая разброс градиентов без фиксированного ограничения для всех токенов.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Обновления LLM при обучении с подкреплением научились защищать от редких расхождений между движками генерации и расчёта градиентов. В препринте, который пока не рецензировали, авторы получили на Qwen1.5-MoE-A2.7B среднюю точность 34,78% против 30,99% без коррекции. Метод пригодится в конвейерах, где ответы генерирует один движок, а модель обновляет другой.

Оба движка загружают одинаковые параметры, но различия в вычислительных ядрах, порядке операций и числовой точности меняют вероятности отдельных токенов. В моделях со смесью экспертов расхождение усиливает маршрутизация: небольшая численная ошибка может отправить токен к другому набору экспертов.

Обычная выборка по значимости исправляет сдвиг, умножая градиент токена на отношение вероятностей двух движков. Редкие большие отношения делают оценку градиента нестабильной: взвешенный второй момент, который определяет её разброс, достиг 22,9 — более чем в 20 раз выше оценки без коррекции. Фиксированное ограничение уменьшает разброс, но чаще обрезает токены, в которых модель уверена слабо.

Предложенный метод CIS отделяет уверенность модели от смещения логарифмических шансов между движками. Он ограничивает только большие положительные смещения одним порогом; после обратного преобразования допустимый вес автоматически становится меньше для токенов с высокой уверенностью. Так CIS ограничивает второй момент постоянной ценой управляемого смещения и не отбрасывает вклад токена полностью.

Метод проверили на трёх моделях со смесью экспертов: Qwen1.5-MoE-A2.7B-Chat, DeepSeek-V2-Lite и Qwen3-30B-A3B. Их обучали на GSM8K и оценивали по пяти математическим наборам; CIS показал лучший средний результат среди рассмотренных способов на каждой модели. Для внедрения нужны исходные логарифмы вероятностей со стороны генерации и дополнительный поэлементный проход без новых прямых или обратных вычислений модели.

Источники

Иллюстрация: рисунок из статьи «Rethinking Training-Inference Mismatch in LLM Reinforcement Learning: Where It Arises and How to Correct It», Tianrun Yu, Kaixiang Zhao, Shangzhe Li и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу