Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM принимают внешнюю подсказку не по единой оценке доверия к источнику: они сильнее тянутся к ответу, который и без неё считали вероятным, и могут использовать его даже после правильной проверки. Хотя препринт не прошёл рецензирование и все числа получили сами авторы, в задачах на логические ограничения модели принимали отвергнутый ими неверный ответ в 93–100% случаев. Для систем с поиском, инструментами и несколькими агентами это разделяет два теста: умеет ли модель найти ошибку и влияет ли найденная ошибка на итоговое решение.
Как отделили проверку ответа от его использования
Sebastien Kawada и Manolis Kellis рассматривают внешнюю информацию как воздействие на уже сложившееся распределение возможных ответов. До подсказки модель сильнее поддерживает одни варианты и слабее другие; сообщение от инструмента, пользователя или другого агента меняет этот баланс.
Эксперимент разделяет три действия. Сначала модель решает задачу без предложенного ответа. Затем в отдельном запуске проверяет готовый вариант. Наконец, получает тот же вариант как внешнюю информацию и выдаёт итоговый ответ. Такое устройство показывает не только точность проверки, но и то, использовала ли модель её результат.
Исходную поддержку варианта измеряли по вероятности его токенов до появления внешнего сообщения. После сообщения сравнивали, насколько выросли его шансы относительно правильного ответа. Авторы провели более 10 миллионов испытаний на 12 моделях и в восьми областях: от арифметики и логических ограничений до квантовой механики, физических систем, генетики и молекулярной биологии.
Правильные и ошибочные варианты подбирали так, чтобы разделить два фактора: насколько ответ изначально нравится модели и насколько легко его проверить. Один и тот же кандидат мог приходить как наблюдение инструмента или как фраза пользователя. Также сравнивали случайные ошибки с характерными ошибками самой принимающей модели.
Собственная правдоподобная ошибка получает преимущество
Чем выше исходная вероятность предложенного ответа, тем охотнее модель принимает его извне. Измеренный вес собственной исходной оценки находился между 0,20 и 0,65 при рациональном ориентире 1. Иными словами, после подсказки модель слишком сильно ослабляла уже имевшиеся основания и переносила вероятность на предложенный вариант.
Поэтому одинаковое сообщение действует на модели по-разному. Слабой модели правильный кандидат помогает исправить исходный ответ. Более сильной тот же механизм может навредить: ошибочный кандидат перетягивает решение, которое без внешней информации было бы правильным.
Особенно опасны не случайные ошибки источника, а варианты, похожие на типичные ошибки самой модели. Они уже занимают заметное место среди её возможных ответов, поэтому внешнее подтверждение усиливает существующее заблуждение. Одинаковая доля ошибок у двух инструментов ещё не означает одинаковый риск для принимающей LLM.
Отдельная проверка не устраняет этот эффект. В отложенных задачах по физическим и биологическим наукам модели использовали до 99,4% неверных кандидатов, которые перед этим правильно отклонили. Причинные вмешательства во внутренние состояния показали, что предложенный ответ попадает в итоговое решение поздно, а представление о результате проверки может существовать отдельно и почти не управлять выбором.
Что меняется в планах команд
Работа не требует отказаться от поиска, инструментов или многоагентных схем. Она меняет единицу проверки: тестировать нужно не источник отдельно и не способность LLM критиковать ответ, а конкретную пару «источник — принимающая модель» в конкретной предметной области.
В набор испытаний стоит включать исходный ответ без внешней информации, правильные подсказки, случайные ошибки и характерные ошибки самой модели. Главная метрика — итоговое решение после подсказки. Если модель пишет, что результат инструмента неверен, но затем воспроизводит его в ответе, текстовая самопроверка не работает как защитный барьер.
Замена модели также требует повторного теста всей цепочки. Работа показывает, что поведение зависит от сочетания модели и области, а размер модели сам по себе его не определяет. Порог доверия, настроенный для одной LLM на арифметике, нельзя автоматически переносить на другую модель или научную задачу.
Для архитектуры отсюда следует практическое разделение ролей. LLM может объяснять проверку, но критические ограничения лучше применять к окончательному действию независимо от её объяснения: блокировать недопустимый ответ, повторно вычислять проверяемую величину или передавать конфликт отдельному компоненту. Иначе система принимает словесный отказ модели за фактический контроль, которого внутри решения может не быть.
Выводы получены в задачах с определяемым правильным ответом и контролируемыми кандидатами. Они дают прямой способ проверять арбитраж в агентных и поисковых системах, но перенос на открытые тексты и длинные рабочие процессы придётся подтверждать на сценариях самого продукта.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



