Журнал · Rit.work

LUGL переносит пакетные модели в обучение с подкреплением

Авторы LUGL отделили сбор игровых данных от обучения модели и показали, как использовать LightGBM вместо нейросетей в задачах игрового обучения с подкреплением.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

David Milec и соавторы предложили LUGL — схему, которая позволяет обучать LightGBM и другие пакетные модели в игровом обучении с подкреплением; работа опубликована как препринт и не проходила рецензирования. В крупнейшем эксперименте агент с LightGBM опередил SD-CFR на 100 тысячных большого блайнда за раздачу. Результат важен для команд, которые работают со структурированными состояниями и выбирают между нейросетями и градиентным бустингом.

Что сделали

Обычный игровой агент собирает новые партии и постепенно обновляет нейросеть. Для градиентного бустинга такой режим неудобен: модель обычно переобучают целиком, а распределение игровых состояний меняется вместе со стратегией агента.

LUGL разделяет этот цикл на локальные обновления и глобальное обучение. Во время игры с самим собой агент записывает в конечную таблицу оценки действий, состояний, стратегий или сожалений — величин, показывающих выгоду от выбора другого действия. Затем по снимку таблицы обучается LightGBM, который обобщает результаты на невстречавшиеся состояния. После этого таблица очищается, новая модель управляет следующими партиями, и цикл повторяется.

Авторы встроили этот подход в аналоги DQN для игр с полной информацией и DeepCFR для игр со скрытой информацией. По их замерам, варианты LUGL были конкурентоспособны или превосходили нейросетевые базовые алгоритмы во всех проверенных играх. В Flop5 Hold’em преимущество оценивали не через точное расстояние до равновесия, а по очным матчам с SD-CFR.

Что это значит

LUGL показывает практический способ применить пакетные табличные модели там, где сбор данных зависит от текущей стратегии. Такой вариант имеет смысл, если состояние можно представить дискретными действиями, картами и позициями на доске, а обучение естественно делится на сбор примеров и последующую аппроксимацию. Работа не доказывает, что бустинг заменяет нейросети в произвольных задачах обучения с подкреплением.

Ограничения. Метод проверяли на девяти настольных и карточных играх; наиболее крупным испытанием был Flop5 Hold’em. Сравнение охватывает DQN, DeepCFR и SD-CFR, но не показывает результат на непрерывном управлении, средах без точного симулятора или неструктурированных входах. После сокращения объёма обучающих данных реализация с LightGBM всё ещё работала примерно в 1,5 раза медленнее нейросетевой базовой линии. Поэтому работа подтверждает применимость схемы для выбранных игровых условий, но не даёт общего сравнения стоимости эксплуатации и масштабирования.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу