Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Способность агента менять поведение под влиянием среды научились задавать как отдельную цель и последовательно оптимизировать в марковском процессе принятия решений. Хотя препринт не рецензирован и числа получили сами авторы, в простейшей среде алгоритм достиг примерно 0,92 бита пластичности, одновременно сведя способность агента управлять будущими наблюдениями к нулю. Для систем постоянного обучения с подкреплением это превращает абстрактный конфликт между восприимчивостью к среде и контролем над ней в две цели, которые можно считать раздельно.
Jeremy Lucas и Doina Precup определяют пластичность как поток информации от наблюдений агента к его действиям: чем сильнее среда влияет на выбор, тем она выше. Обратный поток, от действий к будущим наблюдениям, показывает, насколько агент контролирует происходящее. Максимум одной величины не обязан совпадать с максимумом другой.
Исследователи представили пластичность как сумму текущей информационной ценности и ценности будущих состояний — по схеме уравнения оптимальности Беллмана. Они доказали, что повторный пересчёт сходится к единственному решению и что достаточно искать среди детерминированных политик. Чтобы не перебирать все сочетания действий, алгоритм группирует совпадающие промежуточные распределения с помощью динамического программирования.
В минимальной среде из двух состояний и двух действий политика с максимальной пластичностью полностью потеряла контроль над будущими наблюдениями. Это не побочный эффект обучения, а наглядный результат раздельной оптимизации: цель действительно тянет агента в другую сторону.
Метод проверили также на дороге с пятью состояниями и тремя действиями и в сеточной среде Two-Room с 35 состояниями и четырьмя действиями. В Two-Room агент направлялся в комнату со случайными переходами, где среда сильнее определяла его дальнейшее поведение. Все опыты используют известные вероятности переходов и табличный пересчёт, поэтому работа пока даёт основу для исследований, а не готовый способ обучать нейросетевых агентов в больших или непрерывных средах.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



