Журнал · Rit.work

Cros ограничивает риск при остановке клинического ИИ-агента

Cros проверяет одновременно допустимую ошибку и долю автономных решений, но нынешний опыт подтверждает только применимость подхода, а не клиническую безопасность.

Rit.work
Студия разработки
10 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

К последовательному клиническому агенту добавили контроллер, который решает, когда принять диагноз, запросить следующий тест или передать случай человеку. В препринте University of Memphis, который не прошёл рецензирование и содержит числа, полученные самими авторами, Cros снизил ошибку среди автономных диагнозов с 30,8% до 16,9%, сохранив автономную работу в 78,8% случаев. Для продуктов с дорогими или рискованными действиями это показывает более проверяемую схему остановки, чем порог собственной уверенности модели.

Cros не меняет диагноз и не выбирает тесты вместо основного агента. Отдельный оценщик ранжирует текущие состояния по риску ошибки, после чего контроллер останавливает процесс, продолжает траекторию с предложенным тестом либо передаёт случай на последующую проверку. Порог риска и предельное число шагов образуют набор возможных правил остановки.

Этот набор, порядок проверки и случайное смешивание правил нужно зафиксировать до доступа к калибровочным меткам. Затем точные биномиальные тесты одновременно проверяют два условия: ошибка автономных диагнозов не превышает заданный предел, а агент самостоятельно обрабатывает не меньше заданной доли случаев. Второе условие не позволяет формально снизить риск, передав человеку почти все случаи.

Проверку провели ретроспективно примерно на 1,8 тысячи эпизодов с болью в животе из данных MIMIC. Контроллер шёл по общей записанной траектории одного базового агента, поэтому опыт изолирует решение об остановке, но не показывает результат при самостоятельном выборе других тестов. Дополнительные тесты не всегда помогали: после полного обследования агент ошибался чаще, чем после одной первичной истории.

Текущие результаты не дают сертификата безопасности: метки оценочной части уже использовали на ранних этапах разработки, а совместный критерий риска и автономности выполнялся неустойчиво при повторных разбиениях данных. Cros можно закладывать в архитектуру как проверяемый слой над агентом, но перед клиническим применением правила придётся заморозить и испытать на ранее не просмотренной временной или внешней выборке.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу