Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новый тест показал: ИИ-агенты уже подбирают точные научные прогнозы, но пока не извлекают из них выводы уровня человеческого исследования. В ещё не рецензированном препринте команда из нескольких университетов получила эти числа сама: GPT 6 Astra набрал 47,4% по точности против 48,8% у механизмов, найденных учёными, но по научным выводам — 29,4% против 69,7%. Значит, оценивать агента только по совпадению прогноза с данными недостаточно.
Авторы собрали EurekaBench из задач, где агент получает исходное наблюдение и доступ к среде для экспериментов. Он меняет параметры, проверяет гипотезы, а затем сдаёт описание механизма, его реализацию на Python и журнал работы. Такой формат проверяет весь цикл исследования, а не один ответ на заранее поставленный вопрос.
Результат оценивают по трём сторонам. Механизм должен соблюдать базовые научные ограничения предметной области, точно предсказывать отложенные данные и давать выводы, которые эксперты заранее сформулировали как значимые. Первые два пункта не гарантируют третий: агент может хорошо подогнать функцию, но не установить, почему система ведёт себя именно так и что ещё из найденного механизма следует.
Проверка охватывает 26 задач из нейронауки, геофизики, астрофизики, информатики, физики плазмы и химии. Семь LLM работали как автономные агенты, получая на задачу до четырёх часов и доступ к вычислительной среде. Человеческий ориентир при этом составили результаты уже проведённых исследований, а не учёные, работавшие параллельно с агентами в тех же условиях.
Практический вывод шире научных задач. Если агент должен искать причины, предлагать эксперименты или менять направление работы, в приёмочные испытания стоит включать соблюдение ограничений и проверяемость выводов. Высокая точность на отложенных данных показывает, что модель предсказывает наблюдения, но не доказывает, что она поняла механизм.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



