Журнал · Rit.work

Wayfarer сам находит длинные навыки для сложных задач Atari

Wayfarer учит временные навыки по игровым кадрам и использует их для исследования среды, переноса поведения и более быстрой оценки далёких наград.

Rit.work
Студия разработки
5 октября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

RL-агент научился сам выделять длинные навыки из потока игровых кадров и применять их вместе с обычными действиями. Wayfarer обошёл IQN и Rainbow среди агентов с одним потоком опыта и сравнялся с параллельным DreamerV3, хотя это нерецензированный препринт и все числа получили сами авторы. Для длинных задач с редкой наградой такой подход может заменить часть навыков, которые разработчики обычно задают вручную.

Как Wayfarer превращает опыт в длинные действия

Опция в обучении с подкреплением — это навык, который агент выбирает одним решением, а затем выполняет несколько шагов до завершения. Вместо последовательности команд «подойти, спуститься, взять ключ» верхняя политика может выбрать один навык и вернуть себе управление после его окончания.

Такие действия помогают там, где награда приходит далеко не сразу. Агенту проще связать результат с несколькими длинными решениями, чем с большой цепочкой движений. Направленное поведение также исследует среду лучше, чем случайный перебор отдельных команд.

Wayfarer учит одновременно три нейросети. Первая строит представление среды, вторая превращает его направления в навыки, третья выбирает между навыками и обычными действиями ради игровой награды. Все сети используют общий буфер накопленного опыта и обновляются во время взаимодействия со средой.

Представление Лапласа выделяет признаки, которые медленно меняются по мере движения агента. Они описывают крупную структуру среды: например, области, между которыми трудно перейти. Для каждого направления сеть навыков учится как увеличивать, так и уменьшать значение признака, поэтому получает способы двигаться между такими областями без подсказки в виде игровой награды.

Одних медленных признаков недостаточно: таймер, движение машин или анимация тоже могут меняться независимо от действий агента. Поэтому Wayfarer дополнительно учится восстанавливать совершённые действия по наблюдениям. Это заставляет представление сильнее учитывать то, чем агент действительно управляет. В Freeway без такой настройки главный признак отслеживал медленные автомобили, а с ней — вертикальное положение игрового персонажа.

Главная сеть оценивает навыки по игровой награде, но сами навыки получают внутреннюю награду за движение вдоль признаков представления. Получается замкнутый цикл: накопленный опыт меняет карту среды, карта задаёт новые навыки, а навыки приводят агента в ещё не изученные состояния.

При этом Wayfarer не обязан навсегда зависеть от найденной опции. Когда навык выполняется, буфер сохраняет и его запуск, и последующие обычные действия. Главная сеть учится повторять полезную траекторию на нижнем уровне. В знакомых областях она постепенно выбирает отдельные действия, а опции оставляет для границы освоенной среды.

Подход проверили на десяти играх Atari 2600, отобранных за сложное исследование и далёкие последствия действий. Агенты получали пиксельные наблюдения, обучались до 200 миллионов кадров и использовали одну конфигурацию параметров во всех играх. Wayfarer показал лучший совокупный результат среди систем, которые собирают один поток опыта, а наибольший выигрыш получил в Montezuma’s Revenge и Private Eye.

Проверка отдельных компонентов показывает, что результат даёт не только базовый алгоритм. После 100 миллионов кадров вариант с найденными опциями превосходил вариант без них в 2,51 раза по медианному нормализованному результату. Если использовать навыки только ради исследования и не давать основной сети выбирать их как действия, самые трудные для исследования игры ещё выигрывают, но совокупный результат становится хуже.

Когда подход стоит учитывать в архитектуре агента

Работа меняет планы команд, которые строят агентов для длинных задач с редкой наградой и пока проектируют промежуточные навыки вручную. Wayfarer показывает рабочую альтернативу: извлекать структуру из наблюдений, учить направленные навыки без разметки и позволять политике решать, когда они полезны для основной цели.

Отдельно полезен механизм переноса. Навык опирается не на конкретную комнату или заданную разработчиком цель, а на направление в выученном представлении. Поэтому поведение, найденное в одной части игры, остаётся доступным в ранее не посещённых частях. Для среды с повторяющейся геометрией или одинаковыми типами переходов это снижает потребность заново осваивать каждую область.

Перестраивать любой RL-стек вокруг опций пока рано. Проверка охватывает пиксельные игры Atari с дискретными действиями, а обучение требует длительного взаимодействия со средой. Работа не показывает, как метод поведёт себя в робототехнике, при непрерывном управлении или в средах, где цена каждого опыта высока.

Практический вывод уже уже: если узкое место связано с исследованием, редкой наградой или слишком длинной цепочкой причин и следствий, стоит сравнить ручную иерархию с опциями, найденными онлайн. Если задача короткая и награда быстро следует за действием, дополнительные сети и меняющийся набор навыков могут лишь усложнить обучение.

Источники

Иллюстрация: рисунок из статьи «Mastering Atari 2600 Games with Discovered Options», Erik M. Lintunen, Marlos C. Machado, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу