Журнал · Rit.work

FrontierMath Erdős проверяет модели на задачах без готовых ответов

FrontierMath Erdős сравнил математические возможности моделей на открытых задачах с формальной проверкой решений и одинаковым бюджетом.

Rit.work
Студия разработки
23 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появился единый тест для моделей, которые пытаются решать открытые математические задачи, а не воспроизводить известные доказательства. В препринте Epoch AI и University of Manchester, который не прошёл рецензирование и содержит замеры самих авторов, только GPT-6 Astra набрал 3%, а остальные системы не решили ни одной задачи. Это даёт более строгий ориентир для оценки исследовательских агентов, чем отдельные сообщения об удачных решениях.

FrontierMath Erdős состоит из 68 нерешённых задач Пала Эрдёша, отобранных среди 652 открытых вопросов. Чтобы пройти задание, модель должна доказать гипотезу или её отрицание в Lean. Система Comparator принимает результат, только если доказательство воспроизводится через ядро Lean без дополнительных аксиом и подмены исходного утверждения, поэтому модель-оценщик здесь не нужна.

Авторы сравнили GPT-6 Astra, GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 и Claude Fable 5. Каждая система получила одну автономную попытку на задачу с бюджетом до 300 долларов. GPT-6 Astra доказал одну гипотезу и опроверг другую контрпримером; все прочие попытки завершились без принятого доказательства.

Результат относится одновременно к математическому рассуждению и работе с Lean. Модель может найти верную идею, но не оформить её, особенно если нужной промежуточной теоремы нет в библиотеке Mathlib. Сами задачи отбирали по математической значимости и предполагаемой сложности, поэтому FME измеряет способности на узком наборе исследований в комбинаторике и теории чисел, а не общий уровень научной работы.

Для команд, которые строят автономных исследовательских агентов, FME задаёт полезную схему приёмки: фиксированный набор неизвестных заранее решений, одинаковый денежный лимит и проверяемый результат. Одновременно оценка показывает текущий предел: даже наиболее успешная модель почти всегда исчерпывала бюджет без доказательства.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу