Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Готовые правила о допустимых действиях выгоднее применять во время обучения RL-агента, а не заставлять нейросеть запоминать их. В работе University of the Bundeswehr Munich и The University of Western Australia, которая не проходила рецензирование и приводит замеры самих авторов, два варианта достигли предельного качества на Fetch примерно вдвое раньше базового агента. Если действие может необратимо изменить среду, внешний контроллер также даёт проверяемую гарантию: оно не сработает без заданных предусловий.
Одни правила подключили в трёх местах
RL — это обучение с подкреплением: агент пробует действия и корректирует стратегию по полученной награде. Проблема возникает, когда ему приходится самостоятельно открывать уже известные правила: дверь можно открыть после получения ключа, а предмет — захватить, только когда манипулятор находится рядом и его пальцы разжаты.
Авторы записали такие зависимости в байесовскую сеть предусловий. В этой работе она фактически служит детерминированным набором правил: получает состояние среды, вычисляет логические признаки и разрешает структурные действия. Структурным считается действие, которое меняет мир, например захват, сброс предмета или открытие двери; перемещение агента выделено отдельно.
Символический проверяющий подключается только при выполнении задачи. Он блокирует предложенное политикой действие, если предусловия не выполнены, и автоматически запускает единственное допустимое действие. Обучение при этом не меняется, поэтому такой вариант можно поставить поверх готовой политики, но он не сокращает число проб во время её подготовки.
Символический контроллер работает и при обучении, и после него. Нейросеть отвечает в основном за перемещение к нужному состоянию, а контроллер сам выполняет захват или другое структурное действие. Награда приходит сразу после достижения подходящего состояния, поэтому агенту не приходится отдельно открывать момент запуска действия.
Символический ученик переносит правила внутрь модели. Дополнительная часть нейросети получает признаки и этап задачи, а затем учится предсказывать структурное действие по примерам из той же сети предусловий. При выполнении задачи внешней проверки уже нет: модель может выбрать действие, которое правило не разрешает.
Место подключения меняет и качество, и скорость
В MiniGrid агент видел только часть лабиринта и должен был выполнить длинную последовательность: найти коробку, достать ключ, открыть дверь, освободить руки и забрать предмет. Качество измеряли нормализованной оценкой, которая учитывает как решение задачи, так и длину успешного эпизода. Символический контроллер получил 98,2% против 88,8% у PPO+RND; остальные два варианта также превзошли базовую политику.
В FetchPickAndPlace задача сводилась к непрерывному движению манипулятора и одному структурному действию — захвату куба. SAC+HER и без правил достигал примерно 97% успешных эпизодов, поэтому итоговое качество варианты не разделило. Разница проявилась в обучении: контроллер и ученик вышли на этот уровень примерно за 100 тысяч взаимодействий со средой, тогда как базовой политике потребовалось около 250 тысяч.
Проверку дополнили маршрутизацией по реальной дорожной сети Astoria. Агент должен был доехать до пассажира, выполнить посадку и доставить его к цели, причём конечные точки тестовых маршрутов не использовались как цели при обучении. Внешние варианты лучше переносились на новые маршруты, а встроенный ученик уступил им даже при шестикратном бюджете обучения.
Сравнение охватывает дискретное планирование в MiniGrid, непрерывное управление в Fetch и навигацию по графу улиц. Для первых двух сред использовали сильные специализированные основы — PPO+RND и SAC+HER; в Astoria базового варианта без правил не было, потому что посадку и высадку пассажира обязательно задавал один из трёх механизмов.
Для критичных действий разумный вариант по умолчанию — внешний
Работа меняет архитектурный выбор там, где команда уже знает допустимые условия действий. Для складского робота, сервисного манипулятора или другого агента с фиксированными правилами внешний контроллер во время обучения выглядит предпочтительнее: он сокращает пространство действий, ускоряет получение награды и оставляет журнал причин, по которым сработал захват, сброс или переключение.
Проверяющий подходит для уже обученной политики, которую дорого готовить заново. Он добавляет контроль при эксплуатации, но не исправляет неэффективное исследование среды во время обучения. Встроенный ученик имеет смысл, когда правила нужно упаковать в одну модель, однако его ответ остаётся приближением и не даёт той же гарантии допустимости.
Гарантия внешних вариантов действует при двух условиях: сеть предусловий верна, а признаки правильно извлечены из состояния среды. Она распространяется только на структурные действия, описанные правилами; качество навигации по-прежнему зависит от обученной политики.
В экспериментах использовались небольшие плоские сети предусловий, заданные вручную. Сама структура не отменяет настройку политики, работу с редкой наградой и выбор способа исследования среды. Поэтому результат скорее задаёт порядок проектирования: известные правила стоит сначала вынести в проверяемый слой, а переносить их в веса модели — только при явной необходимости.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



