Журнал · Rit.work

Научные ИИ-агенты анализируют данные, но не умеют проверять выводы

TruthInsightBench отделяет выполнение анализа от научного открытия: четыре ИИ-агента справились с отчётами, но почти не проверяли устойчивость собственных выводов.

Rit.work
Студия разработки
7 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появился TruthInsightBench — набор задач, который проверяет, способен ли научный ИИ-агент сформулировать проверяемый вывод из данных, когда правильный ответ заранее не задан. Zhibo Yang, Chen Zhang, Yuewei Zhang и Hao Wang описали результат в препринте, который не рецензирован и основан на их собственных замерах: четыре агента набрали 58,4–60,3 балла из 100 и статистически не различались. Для разработчиков таких систем это меняет цель проверки: выполненный анализ и аккуратный отчёт ещё не подтверждают способность делать открытия.

В обычных бенчмарках агенту фактически предлагают восстановить результат исходной статьи. В TruthInsightBench он получает нейтральную научную цель, зафиксированные данные и метаданные, но не видит выводы статьи, ожидаемые значения и путь анализа. Поэтому система должна сама решить, какое утверждение поддерживают данные и где проходит граница его применимости.

Модель-оценщик проверяет собственные утверждения агента по шести направлениям, включая воспроизводимость доказательств, устойчивость результата, контрольные проверки и возможность опровергнуть вывод. Оценка опирается на реально запущенный код, промежуточные результаты и отчёт; итог собирается по 29 формальным пунктам без ручной проверки каждого запуска. Положительный эффект не обязателен: обоснованный нулевой результат, контрпример или найденная ошибка метода тоже получает баллы.

Claude Code, Codex CLI, OpenScience и DeepSeek Harness работали с одной зафиксированной базовой моделью. Все четыре уверенно документировали анализ и находили относительно новые наблюдения, но редко проверяли альтернативные объяснения, устойчивость результата и перенос вывода на другие данные. В одной задаче резкие пики могли оказаться либо физическим эффектом, либо артефактом интерполяции — агенты обычно сообщали заметный рисунок, не сравнив методы расчёта.

Проверка охватила 40 слепых задач из десяти научных областей, построенных на открытых данных рецензированных исследований. На каждую пару агента и задачи пришёлся один запуск, а все системы использовали одну модель, поэтому работа сравнивает прежде всего агентские оболочки и не задаёт рейтинг моделей. TruthInsightBench полезен как повторяемая проверка исследовательского контура: он показывает, улучшила ли новая версия научную проверку выводов, а не только написание кода и отчётов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу