Журнал · Rit.work

READY: квалификация ИИ-агентов по надёжности и цене надзора

READY предлагает оценивать корпоративных ИИ-агентов по достижимой надёжности всей системы, объёму человеческой проверки и эксплуатационной стоимости.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из Scale AI, University of California, Santa Cruz и Vanderbilt University Medical Center представили READY — способ квалифицировать ИИ-агентов для конкретных рабочих процессов; работа опубликована как препринт, который не проходил рецензирование. По замерам авторов, при почти одинаковой автономной точности GPT-5.4 потребовал проверки 39,2% случаев, а Sonnet 5 — 29,6%, чтобы пройти порог надёжности 76%. Это важно командам, которые выбирают агента по результатам испытаний, но затем должны определить стоимость и правила его эксплуатации вместе с людьми.

Что сделали

READY рассматривает развёртывание не как свойство одной модели, а как конфигурацию из агента, рабочего процесса и политики человеческого надзора. Один и тот же агент может быть пригоден для одного процесса и не пройти квалификацию для другого: требования к правильности, соблюдению процедур и допустимому риску задаются на уровне конкретной работы.

На входе фиксируются набор типовых случаев, среда выполнения, критерий успешного результата, доступные сигналы для передачи человеку, целевой уровень надёжности и модель эксплуатационной стоимости. Стоимость может включать как запуск агента, так и проверку, исправление или принятие работы сотрудником.

Далее процедура состоит из трёх этапов:

  1. Оценка выполнения. Агент проходит рабочие случаи, а оценщик сохраняет итог, действия с инструментами, использованные доказательства и другие признаки, предусмотренные спецификацией процесса.
  2. Выбор политики надзора. На части данных READY ищет политику с минимальной ожидаемой стоимостью среди тех, которые достигают заданной надёжности. Например, результат можно принять автоматически либо передать специалисту в зависимости от наблюдаемого сигнала риска.
  3. Квалификация. Выбранная политика фиксируется и проверяется на отложенных случаях, которые не использовались при её настройке. Система проходит квалификацию, только если статистическая проверка поддерживает заданный порог.

Результатом становится профиль развёртывания: при каких условиях конфигурация достигает требуемой надёжности, какая доля работы передаётся людям и во сколько обходится обработка. Это условная характеристика рабочего режима, а не универсальный балл модели.

Что показали

Авторы применили READY к 16 агентным системам на 750 случаях ретроспективного клинического аудита. Агент получал вопрос и продольную медицинскую запись, должен был найти относящиеся к вопросу сведения, применить клиническое правило и выдать заключение с оценкой уверенности.

Автономная точность GPT-5.4 и Sonnet 5 составила соответственно 72,8% и 72,5%. Обычная таблица результатов поставила бы эти системы рядом, однако выбранные политики надзора дали разную нагрузку на специалистов. Следовательно, для эксплуатации имеет значение не только частота ошибок, но и возможность заранее выделять случаи, в которых агенту нельзя доверять.

Работа также разделяет подбор политики и доказательство её пригодности. Если выбрать порог передачи человеку и оценить его на одних данных, результат будет учитывать особенности этой выборки. Проверка зафиксированного порога на отложенной части уменьшает риск принять настройку, которая выглядит подходящей только на данных подбора.

Ограничения

Эмпирическая часть охватывает один домен и один ретроспективный рабочий процесс — клинический аудит. Она не показывает, что те же сигналы риска и политики передачи человеку будут работать в поддержке клиентов, финансовых операциях, разработке программ или процессах с другими последствиями ошибок.

В испытании рассматривалась конечная политика «принять результат или отправить на проверку». READY формально допускает вмешательство во время выполнения — уточнение, исправление, повторный запуск или передачу задачи сотруднику, — но авторы не провели масштабную эмпирическую проверку таких вариантов.

Путь человеческой проверки не исполнялся непосредственно во всех оцениваемых конфигурациях. Его успешность, задержка и стоимость могут задаваться как предположения, поэтому профиль развёртывания зависит от того, насколько эти предположения соответствуют реальной команде. В работе также нет практического сравнения с альтернативной системой квалификации, которая одновременно подбирала бы надзор, учитывала его стоимость и проверяла выбранный режим на отложенных данных.

Квалификация относится только к представленному распределению случаев и зафиксированной версии системы. Работа не проверяет устойчивость профиля при изменении входных данных, инструментов, состава процесса или поведения модели и не заменяет проверки безопасности, конфиденциальности и нормативных требований.

Что это значит

Для команд, уже планирующих агента как автономный компонент, работа меняет последовательность испытаний. Одной метрики точности недостаточно: до запуска потребуется определить критерий успешного выполнения, допустимый порог надёжности, доступные действия проверяющего и цену каждого варианта вмешательства. После этого модели следует сравнивать по минимальной стоимости режима, который проходит заданный порог, а не только по месту в таблице результатов.

Это влияет и на архитектуру продукта. Для подобной квалификации нужны воспроизводимые журналы выполнения, отдельный маршрут человеческой проверки, сохранение сигналов риска, версионирование политики и набор случаев, не участвующий в её настройке. Если вмешательство меняет дальнейшие действия агента, испытательная среда должна уметь выполнять весь процесс с участием проверяющего, а не только повторно оценивать сохранённый ответ.

READY не даёт готового ответа о рентабельности конкретного внедрения: фактические затраты на специалистов в исследовании не измерены для каждой организации. Но подход полезен как схема приёмки. Он переносит решение с вопроса «какая модель точнее» на проверяемое условие: какой режим совместной работы агента и человека достигает требуемой надёжности и укладывается в эксплуатационный бюджет.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу