Журнал · Rit.work

В стратегической игре длинный контекст работал как экстраполяция

История взаимодействий улучшала решения GPT-5 и Qwen3-Plus при плавном тренде, но переставала помогать после перестановки тех же входных значений.

Rit.work
Студия разработки
17 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Длинная история взаимодействий помогает LLM-агентам в стратегической игре только пока в ней сохраняется простой тренд. В эксперименте Fudan University выигрыш исчезал после перестановки тех же цен; препринт не рецензирован, а числа получили сами авторы. Поэтому длинный контекст сам по себе не доказывает, что агент пересчитывает ожидания о действиях других участников.

Агентов поместили в повторяющуюся игру с общественным благом. Каждый участник видел текущую стоимость проекта и решал, присоединяться ли к нему, а выгода зависела от решений всей группы. Эталоном служило равновесие рациональных ожиданий: при одной и той же текущей цене оптимальное решение не зависит от порядка прошлых цен.

Исследователи оставляли набор цен неизменным, но показывали их либо как плавную последовательность, либо как скачки между высокими и низкими значениями. Если модель действительно рассуждает о намерениях других агентов, такая перестановка не должна менять качество решений. Если она продолжает замеченный тренд, скачки лишают её полезной подсказки.

Для GPT-5 при слабой взаимозависимости и растущей последовательности три прошлых раунда снизили среднюю квадратичную ошибку относительно равновесия с 6,18 до 0,84 — более чем в семь раз. В сходящейся скачкообразной последовательности ошибка даже с более длинной историей оставалась выше 6,5. При сильной взаимозависимости она превышала 13,88: ошибки отдельных агентов усиливались через решения группы.

Проверка охватывала GPT-5 и Qwen3-Plus, группы по 50 агентов и сессии по шесть раундов в одной игре с фиксированным шаблоном запроса. Результат относится к короткой истории и конкретной форме стратегической зависимости. Для многоагентных систем из него следует практический тест: переставить или нарушить исторический тренд и проверить, сохранится ли выигрыш от контекста.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу