Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель мира для управления роботом научили сохранять различия между последствиями похожих действий, а не только точно продолжать записанную траекторию. В нерецензированном препринте, где все числа получили сами авторы, AD-WM повысила успех на сложных стартах OGBench-Cube с 3,7% до 52% относительно сопоставимой LeWM. Для систем с управлением по прогнозирующей модели (MPC) это меняет цель обучения: минимальная ошибка следующего состояния ещё не гарантирует правильный выбор действия.
MPC перебирает последовательности действий, прогнозирует их результат и исполняет начало лучшей последовательности. Обычную модель мира обучают на фактических переходах из собранных данных. Если сцена почти не меняется, модель может хорошо воспроизводить её постоянную часть, но скрывать небольшую разницу между движением к объекту и от него.
AD-WM предсказывает не всё следующее состояние, а изменение его скрытого представления. Две дополнительные учебные задачи требуют восстановить выполненное действие по текущему и предсказанному состояниям. Так модель сохраняет признаки, по которым планировщик отличает последствия кандидатов; после обучения вспомогательные блоки удаляют, поэтому сам планировщик менять не нужно.
На Cube у LeWM была самая низкая ошибка фактического прогноза, но худший результат управления. Лучше с успехом совпадало качество финального набора кандидатов: сохранялась ли среди выбранных последовательность, близкая к лучшей при реальном исполнении. Значит, проверять такую модель только по ошибке на отложенных переходах недостаточно.
Метод проверяли в симуляторах Cube, Reacher, TwoRoom, PushT и Scene, а также на одном роботе Franka. На Franka использовали замороженный кодировщик V-JEPA 2, данные DROID и вручную заданные промежуточные визуальные цели; успех базового переноса предметов вырос с 42,2% до 71,1% без адаптации на данных лаборатории. Для продуктовой системы вывод узкий: если модель сравнивает альтернативные действия, в обучение и приёмочные тесты стоит включать различимость этих действий, а не полагаться только на точность прогноза.
Источники
Иллюстрация: рисунок из статьи «AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control», Jiabin Qiu, Zixuan Chen, Hongye Cao и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



