Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Появился TruthInsightBench — набор задач, который проверяет, способен ли научный ИИ-агент сформулировать проверяемый вывод из данных, когда правильный ответ заранее не задан. Zhibo Yang, Chen Zhang, Yuewei Zhang и Hao Wang описали результат в препринте, который не рецензирован и основан на их собственных замерах: четыре агента набрали 58,4–60,3 балла из 100 и статистически не различались. Для разработчиков таких систем это меняет цель проверки: выполненный анализ и аккуратный отчёт ещё не подтверждают способность делать открытия.
В обычных бенчмарках агенту фактически предлагают восстановить результат исходной статьи. В TruthInsightBench он получает нейтральную научную цель, зафиксированные данные и метаданные, но не видит выводы статьи, ожидаемые значения и путь анализа. Поэтому система должна сама решить, какое утверждение поддерживают данные и где проходит граница его применимости.
Модель-оценщик проверяет собственные утверждения агента по шести направлениям, включая воспроизводимость доказательств, устойчивость результата, контрольные проверки и возможность опровергнуть вывод. Оценка опирается на реально запущенный код, промежуточные результаты и отчёт; итог собирается по 29 формальным пунктам без ручной проверки каждого запуска. Положительный эффект не обязателен: обоснованный нулевой результат, контрпример или найденная ошибка метода тоже получает баллы.
Claude Code, Codex CLI, OpenScience и DeepSeek Harness работали с одной зафиксированной базовой моделью. Все четыре уверенно документировали анализ и находили относительно новые наблюдения, но редко проверяли альтернативные объяснения, устойчивость результата и перенос вывода на другие данные. В одной задаче резкие пики могли оказаться либо физическим эффектом, либо артефактом интерполяции — агенты обычно сообщали заметный рисунок, не сравнив методы расчёта.
Проверка охватила 40 слепых задач из десяти научных областей, построенных на открытых данных рецензированных исследований. На каждую пару агента и задачи пришёлся один запуск, а все системы использовали одну модель, поэтому работа сравнивает прежде всего агентские оболочки и не задаёт рейтинг моделей. TruthInsightBench полезен как повторяемая проверка исследовательского контура: он показывает, улучшила ли новая версия научную проверку выводов, а не только написание кода и отчётов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



