Журнал · Rit.work

Агентам показали общий бюджет — и они всё равно его превысили

Эксперименты показывают, почему команде ИИ-агентов недостаточно видеть общий счётчик и когда системе нужен единый владелец состояния.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Локально правильные действия нескольких ИИ-агентов могут складываться в ошибочный общий результат, если никто не владеет полным состоянием задачи. Xin Heng из Tote AI показал границу этого сбоя: модель решила 40 из 40 задач при видимом решающем событии, но лишь 12–17 из 40, когда его скрыли; препринт не рецензирован, а числа получили сами авторы. Для архитектуры это переносит ответственность с выбора более сильной LLM на обмен состоянием и контроль применения изменений.

Формальная граница проста: если агент видит одинаковую картину в двух ситуациях, но правильные действия в них различаются, никакие дополнительные рассуждения, роли или голосование не гарантируют верный выбор. Более сильная модель лучше работает с доступным контекстом, но не восстанавливает факт, которого там нет.

Авторы предлагают отделить предложения моделей от права менять систему. Управляющая оболочка (harness) должна хранить общий бюджет, версии прочитанных данных и другие факты, от которых зависит допустимость следующего шага. Перед применением изменения она проверяет, не устарели ли исходные данные и не нарушает ли действие общее правило; менеджер-агент эту роль не заменяет, потому что сам видит лишь часть состояния.

На TeamBench обычные команды превысили общий лимит во всех 5 из 5 запусков. Видимый счётчик почти не помог: нарушения остались в 4 из 5 запусков. Когда оболочка сама владела счётчиком и отклоняла действие сверх лимита, нарушений не осталось ни в одном запуске.

Работу проверяли на синтетической задаче с пропущенным событием, TeamBench, τ2-bench Telecom и нескольких задачах согласования данных. Агентские эксперименты использовали одну семью моделей и небольшие серии запусков. Там, где обычный решатель уже хранил всё значимое состояние, он сравнялся с общей оболочкой: отдельный слой нужен не всегда, а прежде всего при разделённых правах, общих ресурсах и данных, которые меняются, пока агенты рассуждают.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу