Журнал · Rit.work

DAYJOB выявил скрытые провалы ИИ-агентов в профессиональной работе

DAYJOB проверяет, замечают ли ИИ-агенты неверные исходные данные и противоречия в документах, а не только выпускают внешне связный результат.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

ИИ-агенты часто выпускают убедительный документ, не заметив, что исходный запрос или ключевые данные неверны. В препринте Surge AI, который не проходил рецензирование и приводит числа, полученные самими авторами, лучший результат Claude Opus 5.5 составил 24,7% успешно завершённых медицинских задач и 23,9% финансовых. Значит, выбор сильной модели пока не заменяет проверки исходных посылок и итоговых файлов.

DAYJOB состоит из 130 заданий из здравоохранения и финансов. Агент получает короткий запрос и рабочую папку с PDF, таблицами, документами и посторонними материалами. Он должен сам понять, какие файлы важны, проверить противоречия и подготовить рабочий результат: например, медицинскую записку, апелляцию, кредитное заключение или аудиторские документы.

Попытка засчитывается, только если итог отвечает всем критериям экспертной рубрики. Модель-оценщик открывает созданные файлы, проверяет расчёты и ищет конкретные запрещённые ошибки. При таком строгом подходе медианная конфигурация справилась лишь с 0,6% медицинских и 2,5% финансовых заданий.

Главный класс провалов — последовательная работа с неверной посылкой. В одном задании агент нашёл небольшие нарушения правил оценки активов, но пропустил ошибку в единицах валюты, которая завысила позицию на 25,7 млн долларов. В другом Qwen 3.8 Max принял электронные выплаты за напечатанные чеки: использовал объём 2 838 вместо 138 и рекомендовал более дорогой вариант обработки.

Обычные тесты часто дают подробное задание, мало исходных файлов или частичный балл за верные пункты. DAYJOB проверяет другой режим: короткая просьба, смешанный архив и необходимость не просто выполнить поручение, а вовремя оспорить его предпосылку. Проверяли 30 конфигураций моделей в изолированной среде с терминалом, редактором файлов и без доступа к поиску; поэтому результаты относятся именно к длинным задачам в двух профессиональных областях.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу