Журнал · Rit.work

SIPO учит модель находить полезные шаги в собственных решениях

SIPO дополняет проверяемую награду оценкой отдельных токенов, сохраняет длинные рассуждения и извлекает пользу даже из групп неудачных ответов.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель научили разбирать собственное решение по шагам, не привлекая отдельную модель-учителя. Хотя препринт не рецензирован, а числа получили сами авторы, на математических задачах SIPO показал средний результат 59,4 против 57,3 у GRPO. Для команд, которые уже обучают LLM по проверяемой награде, это повод испытать более точное распределение награды, но не менять весь контур обучения.

Две версии контекста показывают, какой шаг помог

Обучение с подкреплением по проверяемой награде обычно оценивает только итог. Решение задачи получает единицу или ноль, а все его токены наследуют один и тот же вес обновления. Модель узнаёт, что ответ оказался неверным, но не видит, на каком переходе рассуждение сломалось.

GRPO частично решает проблему, сравнивая несколько ответов на один запрос. Однако если вся группа ошиблась, относительные оценки становятся нулевыми. При обучении Qwen3-8B на DAPO-Math-17k такие группы составляли 20–30% в начале и около 10% в конце обучения: вычисления на их генерацию не давали обучающего сигнала.

SIPO сохраняет проверяемую награду, но добавляет оценку каждого токена. Для ответа модель получает два расширенных контекста. В положительном находится эталонный ответ, в отрицательном — ошибка из той же группы: собственный неверный результат или наиболее частая ошибка других попыток.

Одна и та же модель заново оценивает уже сгенерированные токены в обоих контекстах. Если токен вероятнее при верной подсказке, чем при ошибочной, он получает положительный вес. Разность оценок важнее их абсолютных значений: склонность учителя сокращать рассуждение или слишком уверенно вести к ответу должна проявиться с обеих сторон и в значительной мере вычесться.

Итоговая награда по-прежнему задаёт направление обновления, а контрастная оценка перераспределяет её между токенами. В группе, где все ответы неверны, эталон позволяет сравнить правильный контекст с ошибкой каждой попытки, поэтому обучение не останавливается полностью.

Контраст сохранил длинные рассуждения

Проверка отдельных компонентов показывает, что сама по себе токеновая оценка не гарантирует улучшения. RLSD с одним привилегированным учителем набрал на математических тестах 56,7. Когда учителя заставили сравнивать правильный и ошибочный контексты, результат вырос до 58,3, а распространение сигнала на все подходящие ответы добавило ещё 1,1 пункта.

Обычная самодистилляция SDPO на математике постепенно сокращала ответы до менее чем 1000 токенов, одновременно теряя награду. Учитель видел правильный ответ и предпочитал короткий путь к нему, хотя сложным задачам требовалось развёрнутое рассуждение. У SIPO это предпочтение присутствовало в обоих контекстах и вычиталось, поэтому длина рассуждений не обрушилась тем же образом.

Метод проверяли на математике, вопросах по естественным наукам, вызове инструментов и генерации кода. Основной моделью служила Qwen3-8B, а на научных вопросах и инструментах также использовали Olmo3-7B-Instruct. SIPO сравнивали с GRPO, SDPO и RLSD на DAPO-Math-17k, SciKnowEval, ToolAlpaca и LiveCodeBench v6, то есть выводы относятся к моделям такого масштаба и задачам с автоматически проверяемым результатом.

Когда SIPO стоит добавить в план обучения

SIPO не требует внешней LLM и не генерирует дополнительные ответы. За это он платит двумя дополнительными прямыми проходами учителя по уже готовой последовательности. Значит, метод меняет вычислительный профиль обучения: генерация остаётся прежней, но повторная оценка токенов требует GPU-времени и памяти.

Наиболее прямой кандидат для испытания — существующий контур RLVR, где модель уже создаёт группы ответов, а проверяющая функция возвращает однозначную награду. Потребуется изменить функцию потерь, собрать положительный и отрицательный контексты и хранить копию параметров модели-учителя, которую периодически синхронизируют с обучаемой моделью.

Для математики и научных вопросов нужен эталонный ответ, иначе SIPO не сможет обучаться на полностью неудачной группе. В генерации кода эталоном служат тесты, поэтому метод сопоставляет успешную и неуспешную попытки из одной группы. Если все программы провалили тесты, контрастной пары нет и главное преимущество SIPO перед GRPO на таком запросе исчезает.

Работа не требует пересматривать выбор базовой модели или набор данных. Практический шаг — параллельный прогон SIPO и текущего GRPO при одинаковом бюджете генерации с отдельной проверкой времени обучения, длины ответов и доли полностью неудачных групп. Чем чаще встречаются такие группы и чем длиннее нужное рассуждение, тем больше оснований ожидать пользу от контрастного сигнала.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу