Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Код и результаты исследовательского агента научились проверять вместе с написанной им статьёй, а не по отдельности. ReAgent верно вынес итог по 70,83% репозиториев и опередил Codex на 35,41 процентного пункта; в нерецензированном препринте эти числа получили сами авторы. Такой аудит можно поставить отдельным контрольным этапом перед тем, как принимать отчёт автономного агента за результат исследования.
ReAgent сначала превращает утверждения статьи в структурированные карточки: связывает методы, наборы данных, настройки, метрики и заявленные результаты. Затем система читает README, конфигурации, точки запуска и нужные участки кода, чтобы найти жёстко записанные результаты, отсутствующие модули, подмену метода или утечку ответов из тестовых данных.
После статической проверки ReAgent составляет план воспроизведения и запускает подходящие эксперименты. Система сохраняет команды, журналы работы, настройки и полученные файлы, а затем связывает эти свидетельства с конкретными утверждениями. На вручную собранном наборе из 96 пар «статья — репозиторий» заявленные метрики удалось воспроизвести у 33 работ, но только 25 одновременно прошли проверку реализации. Значит, совпадение итоговой цифры ещё не подтверждает, что код реализует описанный метод.
Набор составили только из работ платформы AutoSOTA и сравнили ReAgent со статическими проверками и подходами, которые опираются на повторный запуск. Система оценивает согласованность статьи с приложенным репозиторием, но не научную ценность метода и не корректность исходных предположений. Если запуск блокируют отсутствующий набор данных, повреждённая контрольная точка модели или устаревшие зависимости, ReAgent отделяет такой случай от прямого расхождения результатов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



