Журнал · Rit.work

Argo-Bench оценивает действия агентов вместо SQL-запросов

Argo-Bench проверяет, как агенты исследуют корпоративное хранилище, строят прогнозы и принимают решения, последствия которых можно измерить.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появился Argo-Bench — бенчмарк, который проверяет, может ли агент разобраться в корпоративных данных и принять полезное решение, а не только составить SQL-запрос. В препринте TextQL, который не прошёл рецензирование и приводит замеры самих авторов, лучшая модель справилась почти идеально лишь с 34,8% заданий. Для разработчиков это меняет критерий выбора: важен не верный запрос сам по себе, а последствия действия для бизнеса.

Авторы смоделировали сервис доставки еды в Нью-Йорке и перенесли его операции в хранилище по схеме Oracle E-Business Suite: 235 связанных таблиц и 7,5 млрд строк. Агент видит заказы, выплаты, бухгалтерские проводки и другие корпоративные записи, но не имеет доступа к внутреннему состоянию симулятора — например, к точной разметке мошенничества.

В 210 заданиях нужно не вернуть SQL, а подать результат через специальный интерфейс: заблокировать подозрительные учётные записи, распределить бюджет курьерских выплат, построить прогноз или опубликовать источник для отчёта. Оценщик считает последствия решения по скрытому состоянию симулятора: для блокировок сопоставляет предотвращённый ущерб с потерями от ошибочных санкций, а прогнозы проверяет на периодах, которых агент не видел. Для каждого задания есть исполняемое эталонное решение, поэтому правильный ответ можно получить только из доступного хранилища.

Лучше всех выступила Claude Opus 5.5, однако модели часто анализировали не тот показатель или оптимизировали не ту цель. Проверка охватывала закрытые модели и модели с открытыми весами, но только одну смоделированную компанию с чистым хранилищем без накопленных миграций и противоречащих друг другу таблиц. Публичное хранилище создано с другим начальным состоянием, чем тестовое, поэтому оно позволяет воспроизвести процедуру, но не точные результаты.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу