Журнал · Rit.work

Карту агентного ИИ разделили на модель, обвязку и среду

Обзор исследований агентного ИИ показывает: доступ к инструментам расширяется быстрее, чем подтверждается надёжная автономная работа.

Rit.work
Студия разработки
7 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Расширение набора действий ИИ-агентов пока не доказывает, что они способны надёжно выполнять работу без присмотра. Хотя работа Linsen Zhu и Mengqing Cai не рецензирована и числа в ней получили сами авторы, собранные данные показывают разрыв: в исходной WebArena лучший агент на GPT-4 выполнил 14,41% задач против 78,24% у людей. Для продукта это повод оценивать не только модель, но и всю систему, которая выдаёт ей инструменты, память и полномочия.

Авторы разделили такую систему на модель, управляющую обвязку, рабочую среду и сторону, которая ставит задачу и разрешает действия. Затем рассмотрели её по трём независимым признакам: какие изменения агент вправе вносить, как долго он сохраняет цель и состояние, насколько прямо его действия влияют на цифровой сервис, других участников или физические устройства.

Такое разделение снимает несколько ложных выводов. MCP и Agent2Agent упрощают подключение инструментов и обмен задачами, но сами по себе не проверяют решения агента. Несколько агентов могут распределять роли, однако вместе с этим растут затраты и риск общей ошибки. Симуляции и модели мира помогают обучать и планировать действия, но наличие устойчивой виртуальной среды ещё не превращает систему в самостоятельного исполнителя.

Обзор охватывает исследования и официальные технические спецификации по состоянию на 31 августа 2026 года. Это критический разбор, а не количественный метаанализ: авторы сопоставили результаты для программирования, веб-интерфейсов, игр, робототехники и лабораторного оборудования. Поэтому приведённые оценки относятся к конкретным моделям, обвязкам и условиям тестов, а не ко всему классу агентов.

Практический критерий работы — обоснованное делегирование. Полномочия стоит расширять, когда система фиксирует происхождение действий, соблюдает границы доступа, обнаруживает сбой, безопасно восстанавливается и оставляет человеку возможность вмешаться. Высокий результат модели в бенчмарке не заменяет проверку этих свойств: более способному агенту иногда требуется меньше полномочий, если последствия трудно проверить или отменить.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу