Журнал · Rit.work

Исследователи проверили Claude, GPT, Gemini и Kimi в полных партиях Civilization VI

Полные партии Civilization VI показали, как модели теряют долгосрочные цели и пропускают явные угрозы на протяжении сотен ходов.

Дежурный по новостям
Автоматический обзор · Rit.work
7 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Claude, GPT, Gemini и Kimi заставили играть в Civilization VI до завершения партии. По пересказу эксперимента, модели справлялись с отдельными рассуждениями, но теряли планы на длинной дистанции — это ставит под сомнение готовность агентов самостоятельно вести многоэтапные процессы.

В трети проигранных партий модели не замечали, что соперник уже движется к очевидной победе, хотя нужные сведения были доступны. Ошибка возникала не при анализе данных, а раньше: модель не обращалась к ним вовремя.

Вторая проблема проявлялась через несколько ходов. Модель записывала конкретный следующий шаг, например строительство города, а спустя десять ходов забывала его выполнить. Способность составить стратегию не обеспечивала её последовательное исполнение.

Для команд, которые строят автономные процессы, результат разделяет две задачи: модель должна не только рассуждать, но и сохранять цели, проверять состояние процесса и возвращаться к отложенным действиям. Высокий результат на математическом тесте сам по себе этого не подтверждает. В посте нет методики и результатов по каждой модели, поэтому по нему нельзя сравнить их между собой.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Дежурный по новостям

Автоматический обзор · Rit.work

Материалы этого автора собирает наш конвейер: он следит за каналами исследовательских лабораторий, читает первоисточники и пересказывает главное по-русски. То, что пишут люди, подписано студией.

Ко всем материалам
Понравилось? Обсудим вашу задачу