Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Экспертные ответы можно приблизить к исходной LLM так, чтобы обычное дообучение лучше переносило новый навык и меньше стирало старые. В препринте Harvard University, который не прошёл рецензирование и содержит замеры самих авторов, результат модели на задачах по химии вырос на 31,7%. Это позволяет заменить часть сложного обучения с подкреплением подготовкой данных перед стандартным обучением с учителем.
Экспертный ответ переписывают на языке исходной модели
Обучение с учителем (SFT) берёт готовый правильный ответ и учит модель воспроизводить его. Проблема возникает, когда ответ написал эксперт или другая модель: ход рассуждения может сильно отличаться от того, что исходная LLM считает вероятным.
Такое дообучение способно резко изменить распределение ответов. Модель осваивает новый материал, но хуже переносит его на соседние задачи и теряет часть прежних навыков. Обучение с подкреплением (RL) обычно меньше отклоняется от исходного поведения, потому что учится на собственных ответах модели.
У RL есть обратная слабость. Если модель не может сама найти правильное решение, многократная генерация не даёт полезного сигнала. Особенно это мешает добавлять знания и способы рассуждения, которых у базовой модели ещё нет.
Новый метод оставляет алгоритм SFT без изменений и преобразует сами учебные ответы. Для каждого экспертного решения задают множество допустимых вариантов: они должны сохранять правильный итог и существенную информацию, но могут иначе формулировать рассуждение.
Целевая выборка состоит из допустимых ответов, которые исходная модель считает наиболее естественными. Иначе говоря, метод ищет не любой правильный текст, а правильный текст внутри привычного для модели распределения.
MCMC постепенно приближает ответы к модели
Для построения выборки применяют метод Монте-Карло по марковским цепям, сокращённо MCMC. Процесс начинается с экспертного решения, после чего алгоритм предлагает изменённые варианты и принимает либо отклоняет их с учётом вероятностей исходной модели.
Кандидат должен сохранить смысл и правильность исходной траектории. При этом цепочка постепенно переходит к вариантам, которые базовая модель могла бы с большей вероятностью написать сама. В работе доказано, что после каждого такого шага распределение данных не отдаляется от исходной модели по дивергенции Кульбака — Лейблера, которая измеряет различие двух вероятностных распределений.
Полные ответы не перегенерируют с нуля на каждом шаге. Алгоритм обрабатывает их блоками, выбирает позицию внутри текущего фрагмента и заново создаёт продолжение. Это сокращает вычисления и даёт следующему блоку более подходящее начальное состояние.
Простого запроса «перепиши своими словами» оказалось недостаточно. При увеличении числа шагов MCMC учебные ответы последовательно приближались к распределению Qwen2.5-7B-Instruct, а точность дообученной модели росла. Подготовленная выборка также привязана к конкретной LLM: данные, преобразованные для Olmo, дали слабый результат при дообучении Qwen.
Где подготовка данных может заменить часть RL
Метод проверяли на Qwen2.5 и Olmo-3 в задачах по химии, математике и предметным знаниям со свободной формой ответа. Его сравнивали с обычным SFT, GRPO, другими вариантами RL и OPSD — самодистилляцией, при которой модель учится на собственном распределении ответов с дополнительной экспертной информацией.
В химии SFT после MCMC-выборки улучшило результат базовой модели на 31,7% и превысило прирост OPSD на 4,2%. На MATH500 прирост составил 33,7%, что на 26,9% выше следующего результата среди вариантов RL. Средняя потеря точности на прежних задачах после обучения химии сократилась до 1,1%.
Проверка по нескольким попыткам показала, что модель не просто чаще выбирает уже известные решения. После дообучения она справлялась с отдельными задачами, которые базовая версия не решала даже при многократной генерации. Значит, выборка способна передать новый навык, а не только повысить вероятность существующего ответа.
Для команд это не полная замена RL, а дополнительный путь в постобучении. Он подходит, когда есть качественные экспертные траектории, но базовая модель слишком редко получает правильный ответ и поэтому не даёт устойчивого сигнала награды. После такого SFT можно запускать RL с более сильной начальной модели: в математических тестах эта последовательность дала лучший общий результат.
Цена подхода — дополнительные вызовы LLM до обучения. MCMC несколько раз изменяет и оценивает каждую траекторию, а для новой базовой модели выборку нужно готовить заново. В работе показана зависимость качества от объёма этих вычислений, но не приведён расчёт итоговой стоимости относительно полноценного цикла RL.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



