Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Научных ИИ-агентов предложили оценивать не только по готовой гипотезе, коду или статье, но и по тому, как они дошли до результата. Aayam Bansal и Keertan Balaji собрали OpenDiscoveryTrace; поскольку препринт не прошёл рецензирование, все числа в нём получены самими авторами. При близкой доле успешных решений в 84–89% Claude Opus 4.6 допускал в 30 раз больше ошибок, чем GPT-5.4.
OpenDiscoveryTrace содержит 558 полных трасс работы агентов. Для каждого шага записаны этап задачи, рассуждение модели, вызов инструмента и его результат, ошибка, причина пересмотра решения и заявленная моделью уверенность. Такая схема позволяет увидеть, где агент отклонился от плана, заметил ли проблему и смог ли исправить её до финального ответа.
Трассы различают не только частоту, но и характер сбоев. У Claude Opus 4.6 на неправильную работу с инструментами пришлось 66,7% ошибок, а у GPT-5.4 ошибки рассуждения составили 83,6%. Значит, одинаковая доля успешных ответов может скрывать разные инженерные задачи: одному агенту нужны более строгие проверки вызовов, другому — контроль логики между шагами.
Базовые классификаторы не смогли предсказывать итог по трассе лучше выбора самого частого исхода. Поэтому сам журнал действий ещё не становится готовым детектором провала: нужны признаки и правила оценки, связанные с конкретным процессом. Практически полезны тип ошибки, этап её появления, повторные вызовы инструментов, причины исправлений и расхождение между уверенностью агента и результатом.
Набор охватывает семь моделей и 124 задачи из разработки лекарств, материаловедения, геномики и анализа научной литературы. Основное сравнение процессов провели на передовых моделях с автоматической моделью-оценщиком; большинство открытых моделей работали в упрощённом режиме без полного агентного цикла. Если провайдер запрещает сохранять дословные рассуждения, схема допускает сокращённые записи с переходами между этапами, вызовами инструментов и ошибками.
Источники
Иллюстрация: рисунок из статьи «OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows», Aayam Bansal, Keertan Balaji, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



