Журнал · Rit.work

OpenDiscoveryTrace выявляет скрытые различия научных ИИ-агентов

OpenDiscoveryTrace позволяет сравнивать научных ИИ-агентов по ошибкам, работе с инструментами и исправлениям, которые не видны в итоговом ответе.

Rit.work
Студия разработки
10 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Научных ИИ-агентов предложили оценивать не только по готовой гипотезе, коду или статье, но и по тому, как они дошли до результата. Aayam Bansal и Keertan Balaji собрали OpenDiscoveryTrace; поскольку препринт не прошёл рецензирование, все числа в нём получены самими авторами. При близкой доле успешных решений в 84–89% Claude Opus 4.6 допускал в 30 раз больше ошибок, чем GPT-5.4.

OpenDiscoveryTrace содержит 558 полных трасс работы агентов. Для каждого шага записаны этап задачи, рассуждение модели, вызов инструмента и его результат, ошибка, причина пересмотра решения и заявленная моделью уверенность. Такая схема позволяет увидеть, где агент отклонился от плана, заметил ли проблему и смог ли исправить её до финального ответа.

Трассы различают не только частоту, но и характер сбоев. У Claude Opus 4.6 на неправильную работу с инструментами пришлось 66,7% ошибок, а у GPT-5.4 ошибки рассуждения составили 83,6%. Значит, одинаковая доля успешных ответов может скрывать разные инженерные задачи: одному агенту нужны более строгие проверки вызовов, другому — контроль логики между шагами.

Базовые классификаторы не смогли предсказывать итог по трассе лучше выбора самого частого исхода. Поэтому сам журнал действий ещё не становится готовым детектором провала: нужны признаки и правила оценки, связанные с конкретным процессом. Практически полезны тип ошибки, этап её появления, повторные вызовы инструментов, причины исправлений и расхождение между уверенностью агента и результатом.

Набор охватывает семь моделей и 124 задачи из разработки лекарств, материаловедения, геномики и анализа научной литературы. Основное сравнение процессов провели на передовых моделях с автоматической моделью-оценщиком; большинство открытых моделей работали в упрощённом режиме без полного агентного цикла. Если провайдер запрещает сохранять дословные рассуждения, схема допускает сокращённые записи с переходами между этапами, вызовами инструментов и ошибками.

Источники

Иллюстрация: рисунок из статьи «OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows», Aayam Bansal, Keertan Balaji, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу