Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Claude, GPT, Gemini и Kimi заставили играть в Civilization VI до завершения партии. По пересказу эксперимента, модели справлялись с отдельными рассуждениями, но теряли планы на длинной дистанции — это ставит под сомнение готовность агентов самостоятельно вести многоэтапные процессы.
В трети проигранных партий модели не замечали, что соперник уже движется к очевидной победе, хотя нужные сведения были доступны. Ошибка возникала не при анализе данных, а раньше: модель не обращалась к ним вовремя.
Вторая проблема проявлялась через несколько ходов. Модель записывала конкретный следующий шаг, например строительство города, а спустя десять ходов забывала его выполнить. Способность составить стратегию не обеспечивала её последовательное исполнение.
Для команд, которые строят автономные процессы, результат разделяет две задачи: модель должна не только рассуждать, но и сохранять цели, проверять состояние процесса и возвращаться к отложенным действиям. Высокий результат на математическом тесте сам по себе этого не подтверждает. В посте нет методики и результатов по каждой модели, поэтому по нему нельзя сравнить их между собой.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



