Журнал · Rit.work

Повтор ответа не означает, что рассуждение модели закончено

Самосогласие сокращает цепочку рассуждений слишком рано и фиксирует ошибки, которые модель исправила бы сама; DEER экономит токены с меньшей потерей точности.

Rit.work
Студия разработки
10 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Стабильный промежуточный ответ оказался ненадёжным сигналом для ранней остановки рассуждающей модели. В работе HKUST и University of Oxford, которая не прошла рецензирование и приводит замеры самих авторов, ни одно из 3 520 правил остановки по повторяющемуся ответу не смогло одновременно сохранить точность и заметно сократить расход токенов. Для таких систем нужен отдельный сигнал завершённого рассуждения, а не более строгий порог согласия.

Модель повторяет ответ до того, как решит задачу

Самосогласие (self-consensus) устроено просто. Система через равные промежутки просит модель назвать текущий итог и завершает генерацию, когда несколько последних ответов совпадают. Предполагается, что повторение означает завершённое рассуждение.

Но короткий запрос не считывает готовый ответ, а вынуждает модель выдать его прямо сейчас. Если рассуждение ещё не закончено, модель подставляет промежуточный вариант. Одинаковая формулировка запроса может несколько раз извлечь один и тот же вариант, хотя дальнейшие шаги приведут к другому результату.

В одном из примеров модель повторяла ошибочный ответ 37, поэтому правило остановилось. Продолжив рассуждение, модель нашла правильный ответ 46. Согласие описывало устойчивость промежуточной версии, но ничего не говорило о готовности решения.

Это не редкий крайний случай. При настройке, которая экономила 32% токенов, один из девяти остановленных ответов оказался промежуточным: без остановки модель позднее отказывалась от него. Большинство таких остановок обрывало именно исправление ошибки, а не лишнее повторение уже готового решения.

Изменение формулировки запроса подтвердило причину. На ранних этапах два вопроса об ответе часто извлекали разные значения из одного и того же фрагмента рассуждения. Ближе к концу расхождение сокращалось: к этому моменту модель действительно успевала определиться.

Правила проверяли на одних и тех же траекториях

Для каждого задания сначала записывали полный ход рассуждения, а затем проверяли правила остановки на его сохранённых фрагментах. Такой подход исключает влияние самих проверок на дальнейшую генерацию: все варианты видят одну траекторию и отличаются только моментом, когда решили бы её оборвать.

В основной части использовали две модели и три математических бенчмарка: MATH500, AMC23 и AIME24. Задачи разделили по идентификаторам, чтобы один пример не попадал сразу в выборку для настройки и итоговой проверки. После выбора порогов результат дополнительно сверили на других моделях, включая более крупную и модель с другой архитектурой.

Правила различались размером окна, необходимой долей совпадающих ответов, расписанием проверок и обработкой пустых либо неуверенных ответов. Критерии успеха задали до запуска перебора. Некоторые настройки выглядели приемлемо на выборке для обучения, но ни одна не прошла заданные пороги после переноса на выборку для настройки.

Расход считали по токенам основной генерации и по ответам на промежуточные проверки. Предварительную обработку запроса не учитывали, предполагая повторное использование кеша модели. Точность сравнивали с итоговым ответом полной сохранённой траектории, поэтому метрика показывает, сколько собственных исправлений модели теряет ранняя остановка.

Проверка охватывает задачи по соревновательной математике с однозначным коротким ответом и конкретное семейство правил с одним шаблоном запроса. Результат нельзя напрямую переносить на код, открытые ответы и агентные процессы, но он охватывает типичную реализацию: периодически запросить итог и остановиться после серии совпадений.

Порог согласия не стоит закладывать в архитектуру

Для продуктовой команды вывод относится не к ранней остановке вообще, а к выбранному сигналу. Увеличивать число совпадений бесполезно как основную защиту: правило начинает срабатывать позже и экономит меньше, но промежуточные устойчивые ответы не исчезают.

Контрольный метод DEER проверяет уверенность модели в пробном ответе в точках, где рассуждение дошло до очередного возможного итога. При сопоставимой чистой экономии 28% лучшее правило самосогласия теряло 6,0 процентного пункта точности, а DEER — 0,5 процентного пункта. Это сравнение не доказывает, что DEER лучше любых других методов, но показывает: безопасную остановку в этих условиях построить можно, если измерять другой признак.

Если в проекте уже используется серия запросов «назови текущий ответ», её не следует превращать в единственный выключатель генерации. Согласие можно оставить как дополнительный признак, но решение об остановке должен принимать сигнал, связанный с ходом рассуждения: уверенность на его границе, оценка промежуточных шагов или отдельный обученный детектор завершения.

Такой механизм стоит проверять на сохранённых траекториях до внедрения в выдачу. Команде нужно учитывать стоимость проверочных ответов, сравнивать остановленный результат с полной генерацией и выбирать порог на одних задачах, а проверять на других. Иначе настройка запомнит конкретную модель и набор примеров, а экономия токенов скроет ответы, которые модель успела бы исправить.

Источники

Иллюстрация: рисунок из статьи «Stable Answers, Unfinished Reasoning: Why Self-Consensus Is Not a Safe Early-Exit Signal», Yunxiang Mo, Donghao Zhao, Hejia Geng, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу