Журнал · Rit.work

Повторная разметка опыта сужает выбор в многоцелевом обучении

Подмена запрошенного компромисса достигнутым ухудшила многоцелевое обучение в 19 из 36 условий, а смешивание предпочтений вернуло модели широкий выбор.

Rit.work
Студия разработки
24 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Попытка повторно использовать опыт агента в многоцелевом обучении с подкреплением может сузить набор компромиссов, которым он обучается. В препринте, который не прошёл рецензирование и где числа получили сами авторы, такой приём ухудшил результат в 19 из 36 сочетаний алгоритма и среды. Исправить сбой удалось, сохранив часть исходного запроса при повторной разметке.

Ретроспективная переразметка (hindsight relabeling) заменяет цель перехода тем результатом, которого агент фактически достиг. В обычной задаче это позволяет учиться даже на неудачной попытке. Но в многоцелевом обучении достигнутый компромисс не равнозначен запрошенному: например, упавший в начале эпизода робот показывает лишь случайное соотношение скорости и затрат энергии.

Если повторять такую замену для всего накопленного опыта, оценочная часть алгоритма начинает видеть узкую область предпочтений вместо полного диапазона. Она хорошо осваивает случайно достигнутый компромисс и теряет качество на остальных. Фильтрация шумных переходов, приоритетная выборка и изменения структуры буфера этот эффект не воспроизвели: причиной оказалась сама подмена предпочтений.

Для исправления авторы предложили her_mix: новое предпочтение смешивает достигнутый результат с исходным запросом, причём на достигнутую часть приходится четверть веса. Одна и та же настройка вернула большинство пострадавших сочетаний к базовому уровню, а средняя доля фактически брошенных предпочтений сократилась с 69% до 6%.

Проверка охватила четыре алгоритма, которые учатся на ранее собранном опыте, и задачи непрерывного управления MO-Gymnasium с двумя или тремя целями. Метод не гарантирует улучшения для других классов алгоритмов, но даёт практическое правило: достигнутый компромисс нельзя безусловно подставлять вместо запрошенного, даже если такая замена работает для обычных целей.

Источники

Иллюстрация: рисунок из статьи «On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning», Baptiste Bonin, Caro Strickland, Audrey Durand, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу