Журнал · Rit.work

Trusted answer проверяет вывод, а не рассуждение модели

Авторы проверили 8 LLM-мониторов на 237 решениях по физике: эталонный ответ повышал общую точность, но не помогал находить ошибки в рассуждениях с правильным итогом.

Rit.work
Студия разработки
2 сентября 2026 г.5 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Авторы работы The Answer Is Not the Argument проверили, помогает ли эталонный ответ LLM-монитору находить ошибки в рассуждении другой модели. На 237 решениях физических задач доступ к сертифицированному ответу поднял среднюю balanced accuracy с 0,637 до 0,796. Однако улучшение пришлось прежде всего на решения с неправильным итогом. Если ошибочное рассуждение приводило к правильному ответу, recall, наоборот, снизился с 0,521 до 0,438. Авторы интерпретируют это как переход от проверки аргумента к проверке согласованности вывода с эталоном. Работа опубликована как препринт и не проходила рецензирования.

Что измеряли

Исследователи отобрали 79 текстовых задач по физике из Humanity’s Last Exam. В выборку включали вопросы с точным ответом, для которых требовалось многошаговое физическое рассуждение. GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro подготовили по одному решению каждой задачи. Ошибки не вставляли искусственно: авторы анализировали естественные ответы моделей.

Получившиеся 237 трасс разделили на три группы:

  • 130 решений с правильным ответом и без найденной ошибки;
  • 83 решения с неправильным ответом;
  • 24 критические трассы, где рассуждение содержало ошибку, но итоговый ответ был правильным.

Для каждой ошибочной трассы определяли первый шаг с ложным утверждением. Эталонную разметку собирали из экспертных аннотаций физиков, отдельной многораундовой дискуссии между LLM и финального adjudication со скрытым источником предложенных меток. Человеческая разметка охватила 174 из 237 трасс. Из всех меток 42 установили через авторское adjudication, включая 16 из 24 критических случаев.

Восемь LLM-мониторов оценивали одни и те же решения в нескольких режимах. В BLIND монитор видел задачу и рассуждение, но не эталонный ответ. В HINT ответ показывали как непроверенную подсказку. В CERT его обозначали как заведомо правильный и отдельно предупреждали, что правильный итог не гарантирует корректности рассуждения. В REVISE монитор сначала выносил решение вслепую, а затем мог пересмотреть его после раскрытия сертифицированного ответа. Авторы также использовали контрольное повторное рассмотрение без ответа и пошаговый режим STEP.

Основными метриками стали balanced accuracy, которая поровну учитывает обнаружение ошибок и отсутствие ложных срабатываний, а также точная локализация первого ошибочного шага. Recall отдельно считали для трасс с неправильным ответом и для критических трасс с правильным ответом.

Что показали

Переход от BLIND к CERT повысил среднюю balanced accuracy восьми мониторов с 0,637 до 0,796. Доля всех ошибочных трасс, где монитор одновременно заметил проблему и указал правильный первый ошибочный шаг, выросла с 0,261 до 0,379.

Разделение по типу итогового ответа меняет интерпретацию этих цифр. На трассах с неправильным ответом recall вырос с 0,653 до 0,951. На критических трассах, где ошибка была скрыта правильным выводом, он снизился с 0,521 до 0,438. Разница между изменениями имела одно направление у всех восьми мониторов; рассчитанный авторами 95-процентный bootstrap-интервал составил от +0,256 до +0,506.

Режим REVISE дал похожий результат. После первоначального решения вслепую мониторы, получившие правильный ответ, дополнительно отметили как ошибочные 93,8% ранее пропущенных трасс с неправильным итогом. Среди ранее пропущенных критических трасс новая ошибка была отмечена только в 18,0% случаев.

По интерпретации авторов, сертифицированный ответ предоставляет простой диагностический сигнал: несовпадение итогов указывает, что в решении что-то не так. Но совпадение с эталоном склоняет монитор принять рассуждение, даже если внутри него есть ложный шаг. Поэтому рост общей метрики смешивает две разные способности: проверку аргумента и сопоставление выводов.

Авторы иллюстрируют проблему теоретическим монитором, который вообще не читает рассуждение и отмечает только несовпадение финального ответа с эталоном. На собранном наборе такой монитор получил бы balanced accuracy 0,888, одновременно имея нулевой recall на критических трассах и не умея локализовать ошибки.

Ограничения

Критическая группа содержит 24 трассы, а для 16 из них первый ошибочный шаг определён авторским adjudication. Именно эта часть выборки сильнее всего зависит от решений финального разметчика. Вне пилотного исследования только шесть трасс оценивали несколько людей, поэтому работа не позволяет отдельно измерить влияние конкретных аннотаторов. Один специалист подготовил примерно четверть человеческих меток.

Эталонную разметку создавали с доступом к правильному ответу. Авторы отмечают, что такое условие могло повлиять и на разметчиков: менее заметные ошибки в решениях с правильным итогом могли остаться ненайденными. В результате критическая группа может быть неполной, а часть чистых трасс — содержать неотмеченные ошибки.

Проверка ограничена текстовыми exact-match задачами по физике из одного бенчмарка, 79 вопросами и тремя генераторами решений. В панели нет человеческих мониторов, поэтому работа не сравнивает LLM-проверку с независимой проверкой специалистами в тех же условиях.

Изученные ошибки были обычными ошибками моделей, преимущественно не определявшими конечный результат. Их не оптимизировали для обхода контроля. Поэтому замеры не показывают, как мониторы справляются с намеренным сокрытием, саботажем или adversarial reasoning. Связь с reward hacking авторы предлагают как структурную аналогию, а не как измеренную способность обнаруживать такое поведение.

Есть и неоднородность условий панели. Gemini 3.1 Pro проверял в том числе решения, которые сам генерировал. Kimi K3 запускали с другой температурой и уровнем reasoning. Fable 5 приблизительно для трёх спорных трасс использовали при adjudication, а затем включили в число мониторов. Исключение Fable 5 сохранило направление основного результата у оставшихся семи моделей, но не устраняет остальные различия между режимами.

Что это значит

Работа не требует отказываться от chain-of-thought monitoring, но меняет требования к его оценке. Если команда использует монитор только для проверки совпадения ответа с известным эталоном, CERT-подобный режим соответствует этой задаче. Если система должна подтверждать корректность процесса, высокая aggregate accuracy при доступе к ответу для этого недостаточна.

Для таких систем авторам нужны как минимум три отдельных измерения: результат без доступа к ответу, recall на ошибочных рассуждениях с правильным итогом и точность локализации первого ложного шага. Recall также следует разделять между случаями, где неправильный вывод сам выдаёт проблему, и случаями, где вывод не даёт такого сигнала.

Практические планы меняются у команд, которые считали trusted-answer evaluation доказательством способности монитора проверять цепочку рассуждений. По представленным замерам такой тест может завышать ожидаемую надёжность oversight: монитор получает баллы за обнаружение несовпадения итогов, не проверяя физику или математику промежуточных шагов.

Для команд, использующих эталонный ответ как обычный outcome check, результат скорее уточняет название и границы механизма. Такой монитор проверяет вывод. Применять его как свидетельство корректности аргумента можно только после отдельного answer-blind теста на критических трассах. Количественной оценки для саботажа или намеренно скрытых ошибок эта работа не даёт.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу