Журнал · Rit.work

OpenProblemBench проверяет LLM на задачах без готового ответа

Новый набор задач показывает, как сравнивать исследовательские LLM без эталонных решений и почему результат зависит не только от модели.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM смогли довести до решения часть задач, которые научная литература оставляет открытыми. Хотя препринт команды из University of Science and Technology of China и других организаций не рецензирован и все числа в нём получили сами авторы, в OpenProblemBench модели-оценщики приняли 14% ответов GPT-6-Astra против менее 8% у остальных конфигураций. Для выбора исследовательского агента это означает, что сравнивать нужно всю среду запуска, а не только модель.

В OpenProblemBench вошли 82 задачи из математики и теоретической физики. Для каждой составители дают контекст, исходные допущения, известные результаты и условия, которым должно отвечать решение. Они отбирали задачи, где можно проверить решающий шаг: воспроизвести вычисление, испытать контрпример или разобрать доказательство.

Готового ответа у проверяющих нет. Четыре модели-оценщика независимо проверяют допущения, кванторы, ключевые шаги и полноту результата. Они различают полное решение, частичный прогресс и отсутствие нового результата. Такой подход позволяет оценивать продвижение, но согласие моделей ещё не подтверждает научную корректность: они могут повторить одну математическую ошибку.

Частичные результаты показали больше различий, чем доля решений. Qwen3.8-Max и Kimi-K3 часто продвигались в задаче, но не закрывали последний шаг: переносили конечную проверку на бесконечное семейство, оставляли лемму без доказательства или пропускали исключительный случай. GPT-6-Astra чаще менял представление задачи так, чтобы получить общий аргумент вместо набора вычислительных свидетельств.

Среда запуска заметно влияла на итог. На тех же задачах Qwen3.8-Max получил семь принятых решений через OpenCode и пять через Claude Code. Доступ к интернету не изменил число решений в Claude Code, однако поднял число содержательных частичных результатов с 59 до 68. Значит, воспроизводимое сравнение исследовательских агентов требует одинаковых инструментов, доступа к данным и бюджета выполнения.

Основной прогон охватил семь конфигураций: каждая дала по одному ответу на задачу, могла использовать локальные вычисления и работала без сети. Проверка экспертами предметной области остаётся необходимой перед тем, как считать принятый ответ новым научным результатом.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу