Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Появился единый тест для моделей, которые пытаются решать открытые математические задачи, а не воспроизводить известные доказательства. В препринте Epoch AI и University of Manchester, который не прошёл рецензирование и содержит замеры самих авторов, только GPT-6 Astra набрал 3%, а остальные системы не решили ни одной задачи. Это даёт более строгий ориентир для оценки исследовательских агентов, чем отдельные сообщения об удачных решениях.
FrontierMath Erdős состоит из 68 нерешённых задач Пала Эрдёша, отобранных среди 652 открытых вопросов. Чтобы пройти задание, модель должна доказать гипотезу или её отрицание в Lean. Система Comparator принимает результат, только если доказательство воспроизводится через ядро Lean без дополнительных аксиом и подмены исходного утверждения, поэтому модель-оценщик здесь не нужна.
Авторы сравнили GPT-6 Astra, GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 и Claude Fable 5. Каждая система получила одну автономную попытку на задачу с бюджетом до 300 долларов. GPT-6 Astra доказал одну гипотезу и опроверг другую контрпримером; все прочие попытки завершились без принятого доказательства.
Результат относится одновременно к математическому рассуждению и работе с Lean. Модель может найти верную идею, но не оформить её, особенно если нужной промежуточной теоремы нет в библиотеке Mathlib. Сами задачи отбирали по математической значимости и предполагаемой сложности, поэтому FME измеряет способности на узком наборе исследований в комбинаторике и теории чисел, а не общий уровень научной работы.
Для команд, которые строят автономных исследовательских агентов, FME задаёт полезную схему приёмки: фиксированный набор неизвестных заранее решений, одинаковый денежный лимит и проверяемый результат. Одновременно оценка показывает текущий предел: даже наиболее успешная модель почти всегда исчерпывала бюджет без доказательства.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



