Журнал · Rit.work

RISE превращает прошлый шаг модели в учителя для следующего

RISE строит модель-учителя из контрольных точек собственного обучения и даёт каждому токену отдельный сигнал без внешней LLM.

Rit.work
Студия разработки
7 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковая модель может сама превратить одну итоговую оценку ответа в подробные подсказки для дальнейшего обучения. В препринте Yang Li, Semih Yavuz и Shafiq Joty, который не прошёл рецензирование и содержит замеры самих авторов, метод RISE повысил среднюю точность на математических тестах на 2,2–2,9 процентного пункта относительно GRPO при одинаковом числе проходов оптимизации и одинаковой генерации ответов. Такой подход позволяет улучшать модель без отдельной более крупной LLM-учителя.

Сначала модель проходит обучение с подкреплением по проверяемой награде (RLVR): генерирует решение, получает оценку за конечный результат и обновляет параметры. RISE сравнивает новую контрольную точку с предыдущей или со сглаженной опорной точкой, а затем продолжает найденное направление изменения дальше. Получается синтетическая модель-учитель, которая представляет условное следующее состояние обучения.

Учителя можно построить двумя способами: изменить сами параметры либо продолжить изменение выходных вероятностей модели. Затем текущая модель перенимает распределение вероятностей учителя на каждой позиции ответа. Так один сигнал «решение верно или неверно» превращается в отдельную подсказку для каждого токена, а учитель обновляется после каждого цикла.

Дополнительный выигрыш дал не просто второй проход по тем же данным. RISE опередил вариант GRPO с удвоенным числом шагов оптимизации, но увеличил время итерации в 1,3–1,6 раза относительно обычного GRPO. Новые ответы для фазы переноса знаний генерировать не пришлось: метод повторно использовал уже собранные траектории.

Метод проверяли на моделях размером от 1,7 до 8 млрд параметров в математике, STEM-задачах, генерации кода и многошаговой работе с окружением; сравнивали с GRPO и самодистилляцией через дополнительные подсказки. RISE выигрывал во всех четырёх группах задач, но зависел от устойчивого направления обучения: при коэффициенте продолжения 2 один из предварительных запусков расходился. Если проверяемая награда поощряет ошибочное поведение, метод также усилит именно его.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу