Журнал · Rit.work

Точный ИИ-агент может скрыть нерешённое противоречие

Оценка по конечному ответу пропускает важный сбой: агент замечает конфликт источников по ходу работы, но отвечает уверенно, если не смог его разрешить.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Высокая точность ИИ-агента не гарантирует, что он сообщит о нерешённом противоречии. В работе Johns Hopkins University, которая не прошла рецензирование и приводит числа, полученные самими авторами, упоминания конфликтующих ответов достигали пика в первые 10% хода задачи. Значит, при проверке агента недостаточно оценивать только конечный ответ: сигнал о неопределённости может исчезнуть между поиском и ответом пользователю.

Эпистемическую скромность определили как готовность агента признать границы своих знаний. Её разделили на три наблюдаемых действия: заметить конфликт, попытаться разрешить его новым вызовом инструмента и предупредить пользователя, если правильный ответ так и не найден. Последнее действие засчитывали только для ошибочных ответов, в которых агент прямо говорил об оставшейся неопределённости.

Агенты нередко замечали расхождение в начале работы, но затем теряли его или не переносили в финальный ответ. Простое дополнение к системной инструкции чаще заставляло их предупреждать пользователя, однако нередко снижало точность. Поэтому скромность нельзя добавить одной фразой без проверки побочного эффекта: она зависит от сочетания базовой модели, агентной оболочки и среды оценки.

Проверка охватила четыре агентные оболочки в пяти конфигурациях: Nemotron-ToolOrchestra, Claude Code, OpenHands и Qwen-Agent с двумя моделями. Контролируемые конфликты строили на фактических вопросах из ConflictQA и WikiContradict, а естественные расхождения искали в многошаговых задачах GAIA, MoNaCo и BrowseComp; агентам разрешали до 50 итераций. Для каждой конфликтной задачи использовали контроль без конфликта, но базовые модели были закреплены за оболочками, поэтому эксперимент не разделяет их вклад.

Для продуктовой оценки из этого следует отдельный критерий приёмки: проверять не только долю верных ответов, но и всю последовательность действий. Агент должен сохранять обнаруженное противоречие, ограничивать повторные вызовы инструментов и явно передавать нерешённую неопределённость в конечный ответ.

Источники

Иллюстрация: рисунок из статьи «Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict», Kaiser Sun, Bernal Jimenez Gutierrez, Hongjun Liu и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу