Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из New York University, ETH Zurich, Meta и Tel Aviv University разработали метод офлайн-обучения политик для больших популяций агентов; работа опубликована как препринт, не прошедший рецензирования. В эксперименте обученное представление популяции дало меньшую ошибку прогноза вознаграждения и меньший разрыв Нэша, чем модель полной структуры популяции при одинаковом числе параметров и бюджете оптимизации. Подход важен для систем маршрутизации, распределения ресурсов и других задач, где решение одного участника зависит от совокупного поведения остальных.
Что сделали
Авторы рассматривают среднеполевое обучение с подкреплением (mean-field RL): вместо моделирования каждого агента система описывает распределение состояний и действий всей популяции. Полное распределение тоже может быть слишком большим, поэтому метод обучает неизвестное низкоразмерное представление — агрегат, от которого зависят вознаграждения и переходы между состояниями.
Алгоритм получает ранее записанные траектории представительного агента и снимки популяции. Он совместно обучает отображение в компактное пространство, модель вознаграждения и модель переходов, а затем выбирает политику через оптимистичную оценку возможных отклонений и пессимистичную оценку самой политики. Цель — уменьшить разрыв Нэша: выгоду, которую отдельный агент может получить, односторонне сменив стратегию.
Проверка проведена на одношаговой игре маршрутизации. Полное распределение содержит 400 координат, тогда как структурное представление нагрузки на рёбра — 56. При максимальном проверенном объёме данных — 200000 офлайн-записей и 1024 наблюдения популяции на запись — обученное представление по средним результатам уступило моделям с доступом к истинной структуре, но опередило полное распределение и варианты, не использующие структуру популяции.
Что это значит
Работа показывает потенциальную пользу архитектурного ограничения: если вознаграждение определяется несколькими агрегатами, обучение этих агрегатов может быть практичнее передачи модели полного распределения. Это не готовое доказательство масштабируемости для производственных систем. Эксперимент ограничен синтетической одношаговой маршрутизацией, а теоретическая гарантия опирается на принадлежность истинной модели выбранному классу и достаточное покрытие офлайн-данными. Авторы также называют свой доказуемый алгоритм вычислительно неэффективным. Сравнение проведено при фиксированных архитектуре и бюджете обучения; другая архитектура или больший бюджет для модели полного распределения могли бы изменить итог.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



