Журнал · Rit.work

Подготовка данных помогла SFT обойти RL на части задач

MCMC-выборка приближает экспертные ответы к исходной модели: после этого обычное SFT лучше переносит новые навыки и меньше стирает прежние.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Экспертные ответы можно приблизить к исходной LLM так, чтобы обычное дообучение лучше переносило новый навык и меньше стирало старые. В препринте Harvard University, который не прошёл рецензирование и содержит замеры самих авторов, результат модели на задачах по химии вырос на 31,7%. Это позволяет заменить часть сложного обучения с подкреплением подготовкой данных перед стандартным обучением с учителем.

Экспертный ответ переписывают на языке исходной модели

Обучение с учителем (SFT) берёт готовый правильный ответ и учит модель воспроизводить его. Проблема возникает, когда ответ написал эксперт или другая модель: ход рассуждения может сильно отличаться от того, что исходная LLM считает вероятным.

Такое дообучение способно резко изменить распределение ответов. Модель осваивает новый материал, но хуже переносит его на соседние задачи и теряет часть прежних навыков. Обучение с подкреплением (RL) обычно меньше отклоняется от исходного поведения, потому что учится на собственных ответах модели.

У RL есть обратная слабость. Если модель не может сама найти правильное решение, многократная генерация не даёт полезного сигнала. Особенно это мешает добавлять знания и способы рассуждения, которых у базовой модели ещё нет.

Новый метод оставляет алгоритм SFT без изменений и преобразует сами учебные ответы. Для каждого экспертного решения задают множество допустимых вариантов: они должны сохранять правильный итог и существенную информацию, но могут иначе формулировать рассуждение.

Целевая выборка состоит из допустимых ответов, которые исходная модель считает наиболее естественными. Иначе говоря, метод ищет не любой правильный текст, а правильный текст внутри привычного для модели распределения.

MCMC постепенно приближает ответы к модели

Для построения выборки применяют метод Монте-Карло по марковским цепям, сокращённо MCMC. Процесс начинается с экспертного решения, после чего алгоритм предлагает изменённые варианты и принимает либо отклоняет их с учётом вероятностей исходной модели.

Кандидат должен сохранить смысл и правильность исходной траектории. При этом цепочка постепенно переходит к вариантам, которые базовая модель могла бы с большей вероятностью написать сама. В работе доказано, что после каждого такого шага распределение данных не отдаляется от исходной модели по дивергенции Кульбака — Лейблера, которая измеряет различие двух вероятностных распределений.

Полные ответы не перегенерируют с нуля на каждом шаге. Алгоритм обрабатывает их блоками, выбирает позицию внутри текущего фрагмента и заново создаёт продолжение. Это сокращает вычисления и даёт следующему блоку более подходящее начальное состояние.

Простого запроса «перепиши своими словами» оказалось недостаточно. При увеличении числа шагов MCMC учебные ответы последовательно приближались к распределению Qwen2.5-7B-Instruct, а точность дообученной модели росла. Подготовленная выборка также привязана к конкретной LLM: данные, преобразованные для Olmo, дали слабый результат при дообучении Qwen.

Где подготовка данных может заменить часть RL

Метод проверяли на Qwen2.5 и Olmo-3 в задачах по химии, математике и предметным знаниям со свободной формой ответа. Его сравнивали с обычным SFT, GRPO, другими вариантами RL и OPSD — самодистилляцией, при которой модель учится на собственном распределении ответов с дополнительной экспертной информацией.

В химии SFT после MCMC-выборки улучшило результат базовой модели на 31,7% и превысило прирост OPSD на 4,2%. На MATH500 прирост составил 33,7%, что на 26,9% выше следующего результата среди вариантов RL. Средняя потеря точности на прежних задачах после обучения химии сократилась до 1,1%.

Проверка по нескольким попыткам показала, что модель не просто чаще выбирает уже известные решения. После дообучения она справлялась с отдельными задачами, которые базовая версия не решала даже при многократной генерации. Значит, выборка способна передать новый навык, а не только повысить вероятность существующего ответа.

Для команд это не полная замена RL, а дополнительный путь в постобучении. Он подходит, когда есть качественные экспертные траектории, но базовая модель слишком редко получает правильный ответ и поэтому не даёт устойчивого сигнала награды. После такого SFT можно запускать RL с более сильной начальной модели: в математических тестах эта последовательность дала лучший общий результат.

Цена подхода — дополнительные вызовы LLM до обучения. MCMC несколько раз изменяет и оценивает каждую траекторию, а для новой базовой модели выборку нужно готовить заново. В работе показана зависимость качества от объёма этих вычислений, но не приведён расчёт итоговой стоимости относительно полноценного цикла RL.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу