Журнал · Rit.work

Почему RLVR уводит рассуждения моделей от человеческого языка

На новых задачах RLVR делает цепочки рассуждений менее понятными, а попытка ограничить дрейф языка может снизить максимальную награду модели.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Цепочки рассуждений LLM отходят от понятного человеку языка, когда модель осваивает действительно новую задачу, а не извлекает уже знакомый способ решения. Michael Sullivan и Alexander Koller из Saarland University показали это теоретически и в эксперименте; работа не рецензирована, и числа в ней получены самими авторами. На новых задачах обучение с подкреплением по проверяемой награде (RLVR) вызвало больший дрейф языка, чем обучение с учителем.

RLVR проверяет итоговый ответ, но не оценивает промежуточные рассуждения. Поэтому модель может менять грамматику, вводить собственные значения слов и уходить от человеческого языка, пока правильность ответа растёт. В математической модели такой дрейф при RLVR не имеет верхней границы, тогда как обучение с учителем ограничивает его примерами целевых рассуждений.

Попытка удержать модель около человеческого языка одновременно ограничивает максимальную ожидаемую награду. Этот результат относится к совместному распределению рассуждений и ответов: он не доказывает отдельно, что любое требование писать яснее обязательно ухудшит качество. Но он показывает конфликт между свободой оптимизации и возможностью проверять ход решения по тексту.

В эксперименте сравнили Llama, Gemma и Qwen размером от 1 до 1,5 млрд параметров на задачах GSM8K. Разборчивость измеряли косвенно: другой модели давали всё большую часть цепочки и проверяли, помогает ли она предсказать ответ. После RLVR цепочки Llama и Gemma читались хуже, чем после обучения с учителем, включая контрольные точки с сопоставимым качеством. У Qwen разницы почти не было: около двух третей прироста обеспечило уже знакомое поведение — модель научилась завершать ответ сразу после первого решения.

Отдельные запуски RLVR на одной исходной модели выработали разные языковые привычки и хуже понимали рассуждения друг друга. Проверка охватила текстовые модели малого размера и один математический датасет, а связь между жёстким ограничением дрейфа и потерей награды осталась теоретической. Для систем, которые контролируют агента через его цепочку рассуждений, такой текст нельзя считать стабильным интерфейсом между моделью и проверяющим.

Источники

Иллюстрация: рисунок из статьи «On Language Drift during RLVR Post-Training», Michael Sullivan, Alexander Koller, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу