Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Большие игры со скрытой информацией научились сжимать в задачу, с которой справляется обычный игровой решатель, не создавая отдельный оценщик для каждой игры. Boning Li и Longbo Huang из Tsinghua University снизили эксплуатируемость стратегии на величину до 62%, хотя работа не рецензирована и числа в ней получили сами авторы. Это позволяет начинать разработку решателя с текстового описания правил, а не с калькулятора силы каждого состояния.
Как текстовые правила превращаются в группы состояний
В играх со скрытой информацией решателю приходится учитывать множество приватных состояний: карт на руках, закрытых фишек или тайлов. Информационная абстракция объединяет стратегически похожие состояния в группы и заставляет их использовать одинаковую стратегию. Чем хуже подобрана группа, тем легче оптимальному сопернику использовать различия между состояниями.
Abstraction Agent получает правила игры, описание текущей публичной ситуации и перечень приватных состояний. Ему не нужны примеры правильной группировки, дообучение, симулятор розыгрышей или обход дерева игры.
Сначала LLM предлагает непрерывные стратегические признаки. Для покера это могут быть текущая сила руки, вероятность улучшения, уязвимость перед следующей картой и влияние блокеров. Для каждого признака модель задаёт словесные ориентиры для нижней, средней и верхней части шкалы, чтобы последующие запросы оценивали состояния согласованно.
Затем модель получает состояния пакетами и выставляет каждому набор оценок. Если ответ не удаётся разобрать, система подставляет середину шкалы: состояние не пропадает, но попадает ближе к нейтральной группе. Ответы можно кэшировать, потому что их не требуется пересчитывать при смене числа групп.
После этого алгоритм удаляет почти постоянные признаки и один из двух признаков, если они слишком сильно коррелируют. Оставшиеся оценки выравниваются по масштабу, а алгоритм k-средних собирает близкие состояния в группы.
LLM на этом заканчивает работу. Решатель CFR отдельно вычисляет стратегию для сжатой игры, а затем переносит её на исходные состояния. Метод убирает обход дерева только из этапа построения абстракции, но не заменяет сам решатель и проверку стратегии.
Многомерные признаки помогают при подробном разбиении
Качество измеряли через эксплуатируемость — дополнительный выигрыш, который может получить оптимальный соперник. Чем она ниже, тем ближе стратегия к равновесной и тем меньше вреда внесло объединение разных состояний.
Основная количественная проверка охватила два публичных финальных фрагмента HUNL из набора Libratus. При грубом разбиении Abstraction Agent уступал ожидаемой силе руки, но при более подробном отношение эксплуатируемости нового метода к базовому снизилось с 0,78 до 0,38. Скалярная оценка уже не могла разделять руки с похожей силой, но разной уязвимостью, перспективой улучшения и ценностью блокеров.
Более сильный потенциально-ориентированный метод всё ещё давал лучший результат, поскольку использовал точный карточный оценщик. Abstraction Agent закрыл лишь часть разрыва, зато не требовал такого компонента.
Проверка на новой игре ROVER Trials отделяла построение признаков от воспроизведения известных покерных концепций. LLM видела только правила, однако при увеличении подробности отношение к скалярному базовому методу улучшилось с 0,92 до 0,66. Преимущество над более сложной потенциально-ориентированной базой оставалось в пределах погрешности.
Тот же процесс без изменения запросов применили к PLO4, разным этапам HUNL и Riichi Mahjong. Там оценивали связность и масти карт, различия готовых рук и комбинаций с перспективой, скорость улучшения руки в Mahjong. Количественное сравнение с полноценным решателем приведено только для HUNL и ROVER Trials, поэтому переносимость здесь означает содержательные группы, а не доказанное снижение эксплуатируемости во всех играх.
LLM можно вынести в офлайн-этап игрового решателя
Работа меняет планы команд, у которых уже есть формальное описание игры, но нет оценщика приватных состояний. Вместо разработки симулятора можно сначала проверить более короткую цепочку: LLM предлагает признаки, выставляет оценки, обычный алгоритм строит группы, а существующий решатель проверяет их качеством итоговой стратегии.
Такой подход особенно полезен на раннем прототипе или для малоизученной игры. В опыте с PLO4 обработали 16 432 канонические руки, а для Mahjong содержательные группы получили менее чем за минуту. Вычислительные затраты растут линейно с числом состояний, поскольку каждое нужно оценить, но дерево игры на этом этапе не обходится.
Архитектуру стоит разделить на воспроизводимые слои: текст правил и найденные признаки хранить отдельно, оценки кэшировать, группировку запускать независимо от LLM, а качество проверять в полном решателе. Тогда модель можно заменить, не переписывая остальные компоненты.
Зависимость от модели остаётся существенной: более слабые LLM строили менее полезные абстракции. В работе не приведён расчёт стоимости API, поэтому перед выбором метода команде понадобится пилот на собственном числе состояний. Для проектов без игрового решателя эта схема не создаёт готовую стратегию, а только сокращает объём задачи, которую решателю предстоит обработать.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



