Журнал · Rit.work

CivBench измеряет мониторинг состояния и исполнение планов ИИ-агентами

Авторы CivBench проверили агентов в длинных партиях Civilization VI и обнаружили разрыв между доступной информацией, заявленными планами и последующими действиями.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

В препринте, который не проходил рецензирования, исследователи из University of Oxford, Google DeepMind и других организаций представили CivBench для оценки ИИ-агентов в Civilization VI. По замерам авторов, агенты исполняли лишь 48,2–65,8% собственных ближайших обязательств. Работа важна командам, которые проектируют агентов для длительных процессов с API, внешним состоянием и множеством последовательных действий.

Что сделали

CivBench подключает языковую модель к Civilization VI через MCP: агент получает состояние игры в виде структурированного текста и действует вызовами инструментов. Глобальная информация не появляется в контексте автоматически — агент должен самостоятельно запросить, например, продвижение соперников к победе. Полная партия занимает сотни ходов и требует тысяч вызовов, поэтому среда проверяет не отдельный ответ, а поддержание стратегии на длинной дистанции.

Авторы предложили две метрики уровня интерфейса. Доля проактивного мониторинга показывает, какую часть вызовов агент тратит на проверку скрытого стратегического состояния. RAG@10 измеряет, какая доля обязательств из записанного плана была исполнена в течение десяти следующих ходов.

В журналах взаимодействия агенты проверяли стратегическое состояние реже, чем предписывал общий сценарий, и не усиливали мониторинг к концу партии. Одновременно значительная часть сформулированных ими действий не переходила в вызовы инструментов. Авторы трактуют это как отклонение от инструкции, а не доказательство отсутствия способности рассуждать.

Что это значит

Для прикладного агента одного доступа к данным недостаточно. Если критическое состояние нужно запрашивать отдельно, интерфейсу могут понадобиться обязательные проверки, автоматическая выдача предупреждений и постоянный список незавершённых обязательств. CivBench позволяет измерять такие сбои по журналам действий, а не только по конечному успеху задачи.

Ограничения. Авторы провели 23 партии с четырьмя семействами моделей в двух сценариях; такого масштаба недостаточно для устойчивого рейтинга моделей. Все агенты следовали общему сценарию с подсказками, поэтому работа не показывает поведение без этой поддержки. В сравнении нет случайного или программно заданного базового агента, а обязательства выделяла отдельная модель-оценщик. Работа также не проверяет, улучшат ли предложенные механизмы мониторинга и контроля исполнение в других средах.

Источники

Иллюстрация: рисунок из статьи «CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI», Austin Tudor David Andrews, Liam Wilkinson, Jamie Heagerty и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу