Журнал · Rit.work

RAFALE обновляет потоковую политику без оценки градиента плотности

RAFALE напрямую проводит ограничение по стоимости через потоковую политику и удерживает итоговую стоимость в бюджете на всех задачах Safety-Gymnasium.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Потоковая политика смогла сохранять конкурентную награду и соблюдать заданный бюджет стоимости — штрафного сигнала за опасные состояния. Хотя препринт UCSD не рецензирован и числа получили сами авторы, RAFALE стала единственным сравненным методом, который уложился в бюджет на всех тестовых задачах. Работа даёт прямой способ обучать выразительную политику с ограничениями без промежуточной оценки градиента логарифма плотности распределения действий.

Как ограничение проходит через генератор

В безопасном обучении с подкреплением политика максимизирует суммарную награду, но должна удерживать ожидаемую стоимость эпизода ниже бюджета. Для выбора действия используются два критика: один оценивает будущую награду, другой — будущую стоимость. Множитель Лагранжа задаёт, насколько сильно политика должна учитывать второй сигнал.

Обычный метод складывает награду и линейный штраф. Такая схема может колебаться около границы: политика превышает бюджет, множитель растёт, затем политика становится слишком осторожной, а после ослабления штрафа снова нарушает ограничение.

RAFALE использует расширенный лагранжиан. Пока оценка стоимости действия ниже порога, ограничение не меняет соотношение вероятностей относительно политики, обученной только на награде. Выше порога штраф растёт квадратично, поэтому действия с большей ожидаемой стоимостью подавляются сильнее. Сам множитель сдвигает порог: чем он выше, тем раньше начинает действовать штраф.

Актор — модель, которая выбирает действие, — строит его как конечную точку непрерывного потока из случайного исходного образца. RAFALE вычисляет расширенный лагранжиан для полученного действия и проводит производную обратно через весь путь генерации. В отличие от методов с диффузионным актором, ей не нужно сначала оценивать градиент логарифма целевого распределения, а затем учить генератор ему соответствовать.

Почему регуляризатор работает без плотности действий

Прямое обновление через критика создаёт другую проблему. Если оптимизировать только награду и стоимость, разные исходные образцы могут прийти к одному действию. Политика потеряет разнообразие и перестанет исследовать альтернативы.

Обычно схлопывание сдерживает энтропия: она поощряет распределение, которое не концентрирует всю вероятность в одной точке. Но потоковый генератор не выдаёт готовую плотность действий, поэтому стандартный энтропийный штраф трудно вычислить.

RAFALE вместо плотности измеряет кинетическую энергию пути. Чем сильнее и дольше поток отклоняет образец от случайного опорного процесса, тем выше регуляризатор. Его можно посчитать по скоростям вдоль сгенерированной траектории, не восстанавливая плотность конечного распределения.

Авторы описывают это как односторонний мост Шрёдингера: начальное распределение задано, а конечное формируется наградой, стоимостью и ценой перемещения. Они показывают, что задача в пространстве траекторий эквивалентна энтропийно-регуляризованному выбору действий. При исчезающем шуме она переходит в детерминированную задачу минимальной энергии, которую и оптимизирует актор RAFALE.

Этот вывод объясняет роль каждого слагаемого. Награда притягивает поток к полезным действиям, расширенный лагранжиан отталкивает его от дорогих, а кинетическая энергия не позволяет генератору произвольно перестраивать исходное распределение. Математический мост здесь не отдельный модуль системы, а обоснование вычислимой функции потерь.

Когда RAFALE меняет выбор архитектуры

Метод проверяли на задачах Safety-Gymnasium: локомоции с ограничением скорости и навигации CarGoal. Каждый вариант запускали с пятью случайными инициализациями, а итоговую политику сравнивали с CAL, ALGD, RCRL и RESPO. RAFALE уложилась в бюджет на 7/7 задачах и среди допустимых решений получила лучшую награду на всех задачах локомоции.

Разбор компонентов подтверждает, что результат дала не только более выразительная модель. На Hopper пиковая оценённая стоимость у расширенного лагранжиана составила 174,6 против 902,9 у линейного штрафа с тем же порогом. Замена потокового актора на гауссовский или смесь гауссовских распределений также сделала соблюдение бюджета менее стабильным на проверенных задачах.

RAFALE стоит учитывать, если награда и безопасность тянут действия в несколько разнесённых областей. Одна гауссовская политика в такой ситуации может выбрать один режим и потерять остальные, тогда как поток способен представить многомодальное распределение. Метод также подходит командам, которым нужен автономный актор без вычисления плотности действий во время обучения.

Работа не обосновывает замену более простой архитектуры во всех проектах. Если гауссовский актор уже удерживает бюджет и даёт нужную награду, дополнительный потоковый генератор усложнит обучение без показанной выгоды. Ограничение RAFALE относится к ожидаемой стоимости всего эпизода, а не к запрету опасного действия в каждом состоянии.

Проверка охватывает симуляцию и итоговые политики. Во время обучения стоимость временно превышала бюджет, поэтому RAFALE не гарантирует безопасное исследование на реальном оборудовании. Теория также описывает отдельное обновление актора, а не устойчивость всей связки из актора, критиков и множителя: для систем, где нарушение недопустимо даже на этапе обучения, планы менять рано.

Источники

Иллюстрация: рисунок из статьи «Constrained Flow Policy Updates: A Generalized Schr\"odinger Bridge View», Boyang Li, Matthew Kim, Sylvia Herbert, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу