Журнал · Rit.work

EurekaBench отделил точный прогноз от научного открытия

EurekaBench проверил, способны ли ИИ-агенты не только предсказывать результаты экспериментов, но и находить механизмы, из которых следуют научные выводы.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Новый тест показал: ИИ-агенты уже подбирают точные научные прогнозы, но пока не извлекают из них выводы уровня человеческого исследования. В ещё не рецензированном препринте команда из нескольких университетов получила эти числа сама: GPT 6 Astra набрал 47,4% по точности против 48,8% у механизмов, найденных учёными, но по научным выводам — 29,4% против 69,7%. Значит, оценивать агента только по совпадению прогноза с данными недостаточно.

Авторы собрали EurekaBench из задач, где агент получает исходное наблюдение и доступ к среде для экспериментов. Он меняет параметры, проверяет гипотезы, а затем сдаёт описание механизма, его реализацию на Python и журнал работы. Такой формат проверяет весь цикл исследования, а не один ответ на заранее поставленный вопрос.

Результат оценивают по трём сторонам. Механизм должен соблюдать базовые научные ограничения предметной области, точно предсказывать отложенные данные и давать выводы, которые эксперты заранее сформулировали как значимые. Первые два пункта не гарантируют третий: агент может хорошо подогнать функцию, но не установить, почему система ведёт себя именно так и что ещё из найденного механизма следует.

Проверка охватывает 26 задач из нейронауки, геофизики, астрофизики, информатики, физики плазмы и химии. Семь LLM работали как автономные агенты, получая на задачу до четырёх часов и доступ к вычислительной среде. Человеческий ориентир при этом составили результаты уже проведённых исследований, а не учёные, работавшие параллельно с агентами в тех же условиях.

Практический вывод шире научных задач. Если агент должен искать причины, предлагать эксперименты или менять направление работы, в приёмочные испытания стоит включать соблюдение ограничений и проверяемость выводов. Высокая точность на отложенных данных показывает, что модель предсказывает наблюдения, но не доказывает, что она поняла механизм.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу