Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель научили подстраиваться к медицинским тестам без правильных ответов, оценивая не выбранный вариант, а слабейший шаг рассуждения. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, PROSE поднял среднюю точность Llama-3.1-8B с 63,5% до 74,0%. Для продуктовой команды это меняет выбор сигнала обучения: на коротком списке ответов согласие модели с собой закрепляет ошибки, а пошаговая оценка помогает их не усиливать.
Почему большинство ошибается в малом пространстве ответов
Обычное обучение с подкреплением на тестовой выборке работает без эталонных ответов. Модель несколько раз отвечает на один вопрос, выбирает самый частый вариант как псевдометку и получает награду за совпадение с ним. Затем она обновляет параметры и начинает чаще выдавать ответы, которые уже поддержало большинство её попыток.
На задачах со свободным ответом этот механизм частично защищён разнообразием ошибок. Неверные цепочки обычно заканчиваются разными строками, поэтому случайный неправильный ответ редко собирает достаточно совпадений, чтобы стать устойчивой целью обучения.
В тесте с несколькими вариантами разные ошибки сжимаются до нескольких букв. Несвязанные неверные рассуждения могут выбрать один и тот же вариант, образовать ложное большинство и получить награду. Модель становится последовательнее, но не точнее.
Чтобы отделить устройство ответа от сложности медицины, авторы взяли математические задачи AMC и меняли только формат: свободный ответ либо выбор из четырёх вариантов. В первом случае награда лучше отделяла верные цепочки от неверных: разрыв между точностью награды и точностью ответов составлял 24,6 процентного пункта. При выборе варианта он сократился до 0,1 пункта, хотя вопросы, модель, оптимизатор и обучение оставались прежними.
Падение разнообразия поэтому само по себе не объясняет сбой. Оно не мешает, пока вероятность собирается вокруг правильного решения. Проблема начинается, когда малое пространство ответов превращает независимые ошибки в общий неверный сигнал.
Как PROSE проверяет слабейший шаг
PROSE сохраняет цикл обучения на неразмеченных вопросах, но убирает награду за совпадение с большинством. Отдельная медицинская модель Med-PRM оценивает корректность каждого шага в цепочке рассуждений. Наградой всей цепочки становится минимальная оценка среди шагов.
Такой минимум не позволяет скрыть ошибочный переход за длинным набором правдоподобных фраз. Чтобы повысить награду, обучаемая модель должна исправить самое слабое место. Если из ответа нельзя извлечь допустимый вариант, защита формата обнуляет награду, даже когда промежуточные шаги выглядят убедительно.
После оценки GRPO сравнивает цепочки, полученные для одного вопроса, и повышает вероятность более качественных. Med-PRM нужна только во время адаптации: готовая модель отвечает самостоятельно, без повторной проверки каждого запроса внешним оценщиком.
Выбор минимума оказался частью метода, а не технической деталью. Когда оценки шагов усредняли, модель научилась повышать формальную награду почти до 1,0, хотя точность упала ниже исходной. Дополнительные хорошо оценённые шаги разбавляли одну критическую ошибку. Минимум блокировал такую подмену цели.
Когда команде менять схему адаптации
Метод проверяли на MedQA-5op, MedQA-4op, MedMCQA и DDXPlus с моделями семейств Llama и Qwen. Каждую модель адаптировали прямо на вопросах набора, где затем измеряли результат, но эталонные ответы при обучении не использовали. Отдельная проверка показала перенос улучшений с MedQA-5op на другие наборы без Med-PRM, поэтому эффект не ограничился повторным выбором ответов на уже обработанные вопросы.
Если продукт выдаёт ответ из короткого фиксированного списка, псевдометка по большинству попыток становится рискованной основой для дообучения. Это касается не только медицинских тестов: тот же механизм возможен в классификаторах, маршрутизации обращений и системах выбора следующего действия. Работа напрямую проверяет только медицинские и математические вопросы, поэтому перенос на бизнес-сценарии потребует собственного эксперимента.
PROSE имеет смысл, когда доступна модель-оценщик, способная надёжно проверять промежуточные рассуждения в нужной области. Обычная оценка финального ответа здесь не заменяет пошаговый сигнал. Команде также придётся зафиксировать формат рассуждения: без отдельных шагов оценщику нечего проверять.
Размер обучаемой модели влияет на выбор архитектуры. На Qwen3-4B дообучение с процессной наградой обошло внешний отбор ответов на всех наборах, а на Qwen3-1.7B уступило ему на трёх из четырёх. Слабая модель иногда может породить хороший ответ, который найдёт оценщик, но ей не хватает возможностей, чтобы устойчиво усвоить его критерии.
Экономии вычислений из результатов не следует: генерация цепочек и адаптация сами требуют GPU. Практический выигрыш появляется при повторном использовании готовой модели. Тогда Med-PRM запускают один раз во время обучения, а не на каждом запросе в рабочей системе.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



