Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM смогли довести до решения часть задач, которые научная литература оставляет открытыми. Хотя препринт команды из University of Science and Technology of China и других организаций не рецензирован и все числа в нём получили сами авторы, в OpenProblemBench модели-оценщики приняли 14% ответов GPT-6-Astra против менее 8% у остальных конфигураций. Для выбора исследовательского агента это означает, что сравнивать нужно всю среду запуска, а не только модель.
В OpenProblemBench вошли 82 задачи из математики и теоретической физики. Для каждой составители дают контекст, исходные допущения, известные результаты и условия, которым должно отвечать решение. Они отбирали задачи, где можно проверить решающий шаг: воспроизвести вычисление, испытать контрпример или разобрать доказательство.
Готового ответа у проверяющих нет. Четыре модели-оценщика независимо проверяют допущения, кванторы, ключевые шаги и полноту результата. Они различают полное решение, частичный прогресс и отсутствие нового результата. Такой подход позволяет оценивать продвижение, но согласие моделей ещё не подтверждает научную корректность: они могут повторить одну математическую ошибку.
Частичные результаты показали больше различий, чем доля решений. Qwen3.8-Max и Kimi-K3 часто продвигались в задаче, но не закрывали последний шаг: переносили конечную проверку на бесконечное семейство, оставляли лемму без доказательства или пропускали исключительный случай. GPT-6-Astra чаще менял представление задачи так, чтобы получить общий аргумент вместо набора вычислительных свидетельств.
Среда запуска заметно влияла на итог. На тех же задачах Qwen3.8-Max получил семь принятых решений через OpenCode и пять через Claude Code. Доступ к интернету не изменил число решений в Claude Code, однако поднял число содержательных частичных результатов с 59 до 68. Значит, воспроизводимое сравнение исследовательских агентов требует одинаковых инструментов, доступа к данным и бюджета выполнения.
Основной прогон охватил семь конфигураций: каждая дала по одному ответу на задачу, могла использовать локальные вычисления и работала без сети. Проверка экспертами предметной области остаётся необходимой перед тем, как считать принятый ответ новым научным результатом.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



