Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Попытка повторно использовать опыт агента в многоцелевом обучении с подкреплением может сузить набор компромиссов, которым он обучается. В препринте, который не прошёл рецензирование и где числа получили сами авторы, такой приём ухудшил результат в 19 из 36 сочетаний алгоритма и среды. Исправить сбой удалось, сохранив часть исходного запроса при повторной разметке.
Ретроспективная переразметка (hindsight relabeling) заменяет цель перехода тем результатом, которого агент фактически достиг. В обычной задаче это позволяет учиться даже на неудачной попытке. Но в многоцелевом обучении достигнутый компромисс не равнозначен запрошенному: например, упавший в начале эпизода робот показывает лишь случайное соотношение скорости и затрат энергии.
Если повторять такую замену для всего накопленного опыта, оценочная часть алгоритма начинает видеть узкую область предпочтений вместо полного диапазона. Она хорошо осваивает случайно достигнутый компромисс и теряет качество на остальных. Фильтрация шумных переходов, приоритетная выборка и изменения структуры буфера этот эффект не воспроизвели: причиной оказалась сама подмена предпочтений.
Для исправления авторы предложили her_mix: новое предпочтение смешивает достигнутый результат с исходным запросом, причём на достигнутую часть приходится четверть веса. Одна и та же настройка вернула большинство пострадавших сочетаний к базовому уровню, а средняя доля фактически брошенных предпочтений сократилась с 69% до 6%.
Проверка охватила четыре алгоритма, которые учатся на ранее собранном опыте, и задачи непрерывного управления MO-Gymnasium с двумя или тремя целями. Метод не гарантирует улучшения для других классов алгоритмов, но даёт практическое правило: достигнутый компромисс нельзя безусловно подставлять вместо запрошенного, даже если такая замена работает для обычных целей.
Источники
Иллюстрация: рисунок из статьи «On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning», Baptiste Bonin, Caro Strickland, Audrey Durand, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



