Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Расширение набора действий ИИ-агентов пока не доказывает, что они способны надёжно выполнять работу без присмотра. Хотя работа Linsen Zhu и Mengqing Cai не рецензирована и числа в ней получили сами авторы, собранные данные показывают разрыв: в исходной WebArena лучший агент на GPT-4 выполнил 14,41% задач против 78,24% у людей. Для продукта это повод оценивать не только модель, но и всю систему, которая выдаёт ей инструменты, память и полномочия.
Авторы разделили такую систему на модель, управляющую обвязку, рабочую среду и сторону, которая ставит задачу и разрешает действия. Затем рассмотрели её по трём независимым признакам: какие изменения агент вправе вносить, как долго он сохраняет цель и состояние, насколько прямо его действия влияют на цифровой сервис, других участников или физические устройства.
Такое разделение снимает несколько ложных выводов. MCP и Agent2Agent упрощают подключение инструментов и обмен задачами, но сами по себе не проверяют решения агента. Несколько агентов могут распределять роли, однако вместе с этим растут затраты и риск общей ошибки. Симуляции и модели мира помогают обучать и планировать действия, но наличие устойчивой виртуальной среды ещё не превращает систему в самостоятельного исполнителя.
Обзор охватывает исследования и официальные технические спецификации по состоянию на 31 августа 2026 года. Это критический разбор, а не количественный метаанализ: авторы сопоставили результаты для программирования, веб-интерфейсов, игр, робототехники и лабораторного оборудования. Поэтому приведённые оценки относятся к конкретным моделям, обвязкам и условиям тестов, а не ко всему классу агентов.
Практический критерий работы — обоснованное делегирование. Полномочия стоит расширять, когда система фиксирует происхождение действий, соблюдает границы доступа, обнаруживает сбой, безопасно восстанавливается и оставляет человеку возможность вмешаться. Высокий результат модели в бенчмарке не заменяет проверку этих свойств: более способному агенту иногда требуется меньше полномочий, если последствия трудно проверить или отменить.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



