Журнал · Rit.work

AD-WM различает действия, которые обычная модель мира считает одинаковыми

AD-WM сохраняет в прогнозе различия между действиями и помогает MPC выбирать траекторию, даже когда ошибка предсказания растёт.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель мира для управления роботом научили сохранять различия между последствиями похожих действий, а не только точно продолжать записанную траекторию. В нерецензированном препринте, где все числа получили сами авторы, AD-WM повысила успех на сложных стартах OGBench-Cube с 3,7% до 52% относительно сопоставимой LeWM. Для систем с управлением по прогнозирующей модели (MPC) это меняет цель обучения: минимальная ошибка следующего состояния ещё не гарантирует правильный выбор действия.

MPC перебирает последовательности действий, прогнозирует их результат и исполняет начало лучшей последовательности. Обычную модель мира обучают на фактических переходах из собранных данных. Если сцена почти не меняется, модель может хорошо воспроизводить её постоянную часть, но скрывать небольшую разницу между движением к объекту и от него.

AD-WM предсказывает не всё следующее состояние, а изменение его скрытого представления. Две дополнительные учебные задачи требуют восстановить выполненное действие по текущему и предсказанному состояниям. Так модель сохраняет признаки, по которым планировщик отличает последствия кандидатов; после обучения вспомогательные блоки удаляют, поэтому сам планировщик менять не нужно.

На Cube у LeWM была самая низкая ошибка фактического прогноза, но худший результат управления. Лучше с успехом совпадало качество финального набора кандидатов: сохранялась ли среди выбранных последовательность, близкая к лучшей при реальном исполнении. Значит, проверять такую модель только по ошибке на отложенных переходах недостаточно.

Метод проверяли в симуляторах Cube, Reacher, TwoRoom, PushT и Scene, а также на одном роботе Franka. На Franka использовали замороженный кодировщик V-JEPA 2, данные DROID и вручную заданные промежуточные визуальные цели; успех базового переноса предметов вырос с 42,2% до 71,1% без адаптации на данных лаборатории. Для продуктовой системы вывод узкий: если модель сравнивает альтернативные действия, в обучение и приёмочные тесты стоит включать различимость этих действий, а не полагаться только на точность прогноза.

Источники

Иллюстрация: рисунок из статьи «AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control», Jiabin Qiu, Zixuan Chen, Hongye Cao и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу