Журнал · Rit.work

Надзору за ИИ-агентами нужен проверяемый повод изменить решение

Запись решения ИИ-агента должна показывать, при каком условии он выбрал бы иначе, иначе объяснение может лишь подталкивать человека к одобрению.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Объяснение ИИ-агента нельзя считать проверяемым, если из него неясно, при каком условии агент выбрал бы иначе. Jérémie Lumbroso предлагает этот критерий в препринте, который не прошёл рецензирование, а приведённые числа получил сам автор. Для продуктовой команды это сдвигает надзор с кнопки «одобрить» на журнал решений, по которому другой специалист может проверить логику агента.

Работа разделяет две функции речи. Кибернетическая речь направляет действие: команда успешна, когда её выполнили. Эпистемическая речь передаёт понимание: объяснение успешно, когда отвечает фактам и позволяет проверить вывод. Проблема возникает, когда ответ выглядит как объяснение, но на деле лишь подталкивает проверяющего поставить отметку.

Для проверки предлагается тест реконструкции из двух частей. Сначала второй специалист читает запись и предсказывает, как агент поступит после изменения одного из условий. Затем агент получает изменённую задачу: если его выбор расходится с прогнозом, нужно выяснить, была ли причина декоративной, неполной или вообще не влияла на решение.

Запись должна содержать варианты, рекомендацию, обоснование, уверенность и условие пересмотра. Фраза «если мы ошиблись, миграция займёт неделю» тест не проходит: она описывает цену ошибки, но не говорит, что заставит выбрать другой вариант. В разобранном журнале все 10 таких условий со временем превратились именно в описания затрат — форма сохранилась, а возможность проверить решение исчезла.

Подход показан на трёх эпизодах одного специалиста: отдельном проектном решении, мобильном приложении и архитектуре программного проекта. В работе также разобраны публичная запись пересмотра рекомендации и случай надзора без зафиксированных причин. Это иллюстрации без контрольного сравнения; сам тест реконструкции на них не запускали, поэтому работа задаёт критерий аудита, но пока не доказывает, что он улучшает результат или сокращает затраты.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу