Журнал · Rit.work

Как дешёвый симулятор стабилизирует PPO на редких реальных данных

MFPG-PPO дополняет редкие данные физического робота дешёвыми симуляциями, но не позволяет ошибкам симулятора напрямую менять цель обучения.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Физический манипулятор Franka научили поднимать куб, обновляя политику после четырёх реальных эпизодов. В работе Xinjie Liu и коллег на самой трудной задаче подход достиг результата PPO, которой дали в 16 раз больше точных данных; препринт не прошёл рецензирование, а все числа получили сами авторы. Для робототехнических команд дешёвый симулятор становится не источником готовой политики, а средством стабилизировать обучение на реальном устройстве.

Симулятор уменьшает шум, но не задаёт цель

Когда робот собирает мало реальных траекторий, оценка градиента политики сильно меняется от одной порции данных к другой. PPO может обновить политику в неверную сторону, после чего новые данные приходят уже от ухудшившегося поведения.

MFPG-PPO делит данные на данные высокой точности (HF) из целевой среды и данные низкой точности (LF) из упрощённого симулятора. Метод не добавляет вознаграждение симулятора к целевой функции. Вместо этого он использует симуляцию как контрольную переменную: вычитает из шумной оценки компонент, который одинаково меняется в реальной и упрощённой средах.

Для этого метод собирает три потока. Первый содержит реальные или точные траектории, второй — связанные с ними траектории симулятора, третий — дополнительные независимые симуляции для оценки среднего значения контрольной переменной.

Связанные траектории начинают из одного состояния и получают одинаковый случайный шум при выборе действий. Симулятор периодически возвращают в записанное состояние точной среды, чтобы динамика двух сред не успела разойтись. Чем сильнее совпадают изменения оценок политики, тем больше шума можно убрать без прямой оптимизации по ошибочной динамике симулятора.

Эта схема отличается от совместного обучения на реальных и синтетических данных. При простом смешивании политика частично оптимизирует цель упрощённой среды и наследует её ошибки. MFPG-PPO сохраняет целью поведение в точной среде, хотя выбранная авторами схема повторной синхронизации может внести смещение: связанные и независимые траектории симулятора получаются из разных распределений состояний.

Прямая замена REINFORCE на PPO усиливает разброс

Исходный вариант multi-fidelity policy gradients рассчитан на REINFORCE и полные эпизоды. PPO работает с короткими отрезками траекторий, оценивает преимущества через критика и несколько раз использует одну порцию данных. Поэтому простой перенос контрольной переменной теряет связь между средами или сам увеличивает разброс оценки.

MFPG-PPO согласует длину оценки преимущества в точной и связанной упрощённой среде. Для каждого потока он обучает отдельного критика: состояния связанного симулятора отличаются от состояний свободно работающего симулятора, поэтому один критик смешал бы две задачи.

Коэффициент контрольной переменной метод пересчитывает во время обновления политики и сглаживает между итерациями. Перед применением он проверяет, действительно ли скорректированная оценка имеет меньший разброс. Если проверка не проходит, алгоритм ставит коэффициент в ноль и выполняет обычное обновление PPO только по точным данным.

На Franka отдельные шаги плохо совпадали по времени: симулятор и робот захватывали куб в разные моменты. Корреляция пошаговых оценок составляла около 0,17, а после суммирования по эпизоду — около 0,6. Поэтому на роботе коэффициент подбирали по целым эпизодам, а в параллельной симуляции — по отдельным шагам.

Проверка разброса оказалась не страховкой на крайний случай. В вариантах без неё скорректированная оценка иногда становилась более чем в 1000 раз шумнее исходной. Когда одновременно убирали повторную подгонку коэффициента и проверку, обучение на сложной задаче локомоции разрушалось.

Команде понадобится управляемый симулятор, а не только похожая среда

Работа меняет планы команд, у которых уже есть дорогая целевая среда и дешёвая модель той же системы. Для внедрения недостаточно запускать симуляции рядом с реальным обучением. Симулятор должен принимать записанные состояния, воспроизводить управляемую случайность и быстро собирать связанные и независимые траектории.

Метод проверяли на задачах локомоции в параллельных GPU-симуляциях и на физическом Franka, который поднимал куб без человеческих демонстраций. Его сравнили с PPO и SAC на точных данных, а также с базовыми подходами, которые смешивают среды или корректируют расхождение динамики. MFPG-PPO улучшал результат PPO почти во всех сочетаниях задач и бюджетов, а статистически различимого ухудшения не показал.

Практический вывод касается архитектуры контура обучения. Если симулятор нельзя регулярно синхронизировать с целевой средой, ключевой источник корреляции исчезает и переносить результат работы напрямую нельзя. Если синхронизация доступна, в план стоит заложить отдельные критики, оценку корреляции, повторную настройку коэффициента и автоматический возврат к обычному PPO.

Проверки охватывают робототехнику, где состояния и действия двух сред можно явно связать. Работа не устанавливает, что та же конструкция даст такой же выигрыш в других задачах обучения с подкреплением. Даже в рассмотренной схеме остаётся компромисс между высокой корреляцией после синхронизации и смещением, которое возникает из-за разных распределений симуляционных траекторий.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу