Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Потоковые политики научились дообучать по оценкам качества действий без обратного распространения градиента через каждый шаг генерации. Команда KAIST и RLWRLD получила на OGBench среднюю долю успеха 75% против 68% у сильнейшего базового метода, хотя это нерецензированный препринт и все числа получили сами авторы. SQAM может снизить стоимость обновления крупных робототехнических моделей, но требует отдельно контролировать ошибки оценщика.
Как один градиент заменяет цепочку производных
Потоковая политика генерирует действие не за один проход. Она берёт случайный шум и постепенно преобразует его в команду для робота или агента. Чем больше промежуточных шагов, тем точнее модель может описывать сложное распределение действий, но тем труднее дообучать её с подкреплением.
Для такого обучения используют оценщик ценности действий. Он получает состояние среды и готовое действие, а затем предсказывает будущую награду. Чтобы улучшить политику, нужно перенести градиент этой оценки с конечного действия на все промежуточные состояния потока.
Предыдущие методы семейства adjoint matching проводят градиент назад по всей цепочке. На каждом шаге они умножают его на якобиан скорости политики — матрицу, которая показывает, как небольшое изменение промежуточного состояния меняет следующий шаг. Стоимость такого обновления растёт вместе с длиной потока и размером модели.
Авторы измерили усреднённый по пакету данных якобиан у заранее обученных политик. Основная масса значений оказалась на диагонали: каждая координата действия сильнее зависела от самой себя, чем от остальных координат. Поэтому матрицу приблизили одним скалярным множителем.
После такого упрощения перенос градиента выражается напрямую. SQAM берёт градиент оценщика в конечном действии и для каждого момента потока умножает его на оставшееся время. Направление остаётся общим для всей цепочки, а величина уменьшается по мере приближения к начальному шуму.
Точное выражение содержит ещё один множитель, зависящий от якобиана. Его вычисление вернуло бы исходные расходы, поэтому SQAM отбрасывает этот множитель. Эксперименты показывают, что приближение сохраняет две нужные характеристики: градиент уменьшается по ходу потока и остаётся направлен примерно так же, как точный сопряжённый градиент.
Почему без штрафа оценщик ведёт политику в ошибочную сторону
Упрощение переносит проблему из политики в оценщик. Точный метод многократно преобразует градиент через якобианы, а SQAM напрямую использует градиент в действии, которое только что сгенерировала политика. Если оценщик завысил ценность этого действия, ошибка сразу влияет на все шаги потока.
Для стабилизации авторы добавили штраф за ценность действия политики относительно действия из обучающего набора. При обновлении оценщика SQAM сравнивает их в одном состоянии и подавляет необоснованно высокую оценку сгенерированного действия. Дополнительные действия для этого выбирать не нужно: алгоритм повторно использует образец, который уже получил при обновлении политики.
Проверки с отключением отдельных компонентов показывают, что место штрафа существенно. Обучение оценщика только на действиях из набора почти не помогает, потому что он не видит действие текущей политики. Штраф за расстояние между действиями ограничивает саму команду, но не исправляет её оценку. Прямой контроль градиента помогает, однако уступает штрафу за ценность.
Основные замеры охватывают 50 задач из 10 доменов OGBench: перемещение агентов, работу с кубами и другие манипуляции. На самых сложных доменах SQAM обошёл лучший отдельный базовый метод на 18–35 процентных пунктов. Метод также проверили на реальном двуруком роботе: дообучение зрительно-языковой модели действий улучшило результат относительно обучения по демонстрациям во всех трёх задачах.
Когда SQAM меняет план разработки
Работа касается команд, которые уже выбрали потоковую политику и хотят улучшать её по новым взаимодействиям со средой. SQAM обновляет саму генеративную модель, а не замораживает её и не добавляет отдельную поправку к готовому действию. Это сохраняет способность политики описывать несколько подходящих вариантов поведения.
Метод стоит рассматривать, если точное обратное распространение через весь поток ограничивает размер модели, число шагов генерации или частоту обновлений. SQAM убирает произведения вектора на якобиан из каждого шага и оставляет один градиент оценщика для конечного действия. Архитектуру политики при этом не приходится заменять.
План обучения придётся дополнить контролем оценщика именно на действиях текущей политики. Обычной регуляризации по демонстрациям недостаточно: она не охватывает область, куда политика смещается после начала обучения с подкреплением. Для внедрения SQAM поэтому нужны совместные проверки качества политики, калибровки оценщика и устойчивости при переходе от готовых данных к новым действиям робота.
Границы проверки пока заданы OGBench и лабораторными манипуляциями. Результат показывает, что грубое приближение сопряжённого градиента может работать и на крупной политике, но не доказывает одинаковую устойчивость для других роботов, наблюдений и способов построения оценщика.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



