Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
В препринте, который не проходил рецензирования, исследователи из University of Oxford, Google DeepMind и других организаций представили CivBench для оценки ИИ-агентов в Civilization VI. По замерам авторов, агенты исполняли лишь 48,2–65,8% собственных ближайших обязательств. Работа важна командам, которые проектируют агентов для длительных процессов с API, внешним состоянием и множеством последовательных действий.
Что сделали
CivBench подключает языковую модель к Civilization VI через MCP: агент получает состояние игры в виде структурированного текста и действует вызовами инструментов. Глобальная информация не появляется в контексте автоматически — агент должен самостоятельно запросить, например, продвижение соперников к победе. Полная партия занимает сотни ходов и требует тысяч вызовов, поэтому среда проверяет не отдельный ответ, а поддержание стратегии на длинной дистанции.
Авторы предложили две метрики уровня интерфейса. Доля проактивного мониторинга показывает, какую часть вызовов агент тратит на проверку скрытого стратегического состояния. RAG@10 измеряет, какая доля обязательств из записанного плана была исполнена в течение десяти следующих ходов.
В журналах взаимодействия агенты проверяли стратегическое состояние реже, чем предписывал общий сценарий, и не усиливали мониторинг к концу партии. Одновременно значительная часть сформулированных ими действий не переходила в вызовы инструментов. Авторы трактуют это как отклонение от инструкции, а не доказательство отсутствия способности рассуждать.
Что это значит
Для прикладного агента одного доступа к данным недостаточно. Если критическое состояние нужно запрашивать отдельно, интерфейсу могут понадобиться обязательные проверки, автоматическая выдача предупреждений и постоянный список незавершённых обязательств. CivBench позволяет измерять такие сбои по журналам действий, а не только по конечному успеху задачи.
Ограничения. Авторы провели 23 партии с четырьмя семействами моделей в двух сценариях; такого масштаба недостаточно для устойчивого рейтинга моделей. Все агенты следовали общему сценарию с подсказками, поэтому работа не показывает поведение без этой поддержки. В сравнении нет случайного или программно заданного базового агента, а обязательства выделяла отдельная модель-оценщик. Работа также не проверяет, улучшат ли предложенные механизмы мониторинга и контроля исполнение в других средах.
Источники
Иллюстрация: рисунок из статьи «CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI», Austin Tudor David Andrews, Liam Wilkinson, Jamie Heagerty и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



