Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Робота научили намечать промежуточные состояния задачи и сверять с ними дальнейшие действия, не генерируя полный видеопрогноз. В препринте Shanghai Jiao Tong University, SII, Meta и Imperial College London, который не прошёл рецензирование и где числа получили сами авторы, ProWAM выполнил 70% испытаний в новых реальных сценах против 55% у сильнейшего конкурента. Для длинных задач это предлагает промежуточный вариант между дорогой генерацией видео и управлением без явного плана.
Подцели показывают не только результат, но и путь к нему
Модель мира и действий получает изображение текущей сцены и текстовую инструкцию, затем одновременно предсказывает будущие визуальные состояния и команды роботу. Один распространённый подход строит плотный видеоролик будущего: он подробно показывает ближайшие движения, но требует многократно запускать крупную видеомодель. Другой подход сразу выдаёт действия или ориентируется только на конечный кадр, поэтому хуже описывает путь к цели.
ProWAM вместо ролика строит упорядоченный набор разреженных визуальных подцелей. Каждая обозначает состояние сцены на определённой доле оставшегося пути: например, объект уже захвачен, перенесён к контейнеру, а затем уложен внутрь. Позиция задаётся относительно текущего наблюдения, поэтому после очередного действия модель заново привязывает весь маршрут к тому, что действительно увидела камера.
Внутри работают два связанных компонента. Видеокомпонент предсказывает подцели и изменения сцены, а более лёгкий компонент действий превращает эти признаки в последовательность команд. Команды могут учитывать визуальный план, но не меняют его представление внутри видеокомпонента: такое одностороннее взаимодействие помогает сохранить знания, полученные при предварительном обучении на видео.
Обучение разделено на два этапа. Сначала видеокомпонент учится предсказывать развитие сцены и подцели по роликам без записанных команд робота. Затем всю систему дообучают на демонстрациях, где действия уже известны. Так обычное видео передаёт модели представление о движении объектов, а более дорогие робототехнические записи связывают это представление с управлением.
Кэш подцелей сокращает работу крупной видеомодели
При каждом пересмотре плана ProWAM запускает видеокомпонент один раз и сохраняет внутренние признаки подцелей. Компонент действий повторно использует этот кэш, пока постепенно очищает зашумленную последовательность команд. По сравнению с совместной генерацией видео и действий это примерно в десять раз сокращает число запусков видеокомпонента.
Экономия появляется не потому, что система полностью отказывается от визуального прогноза. Она переносит основную работу в несколько опорных состояний и не тратит вычисления на каждый промежуточный кадр. При новом наблюдении робот обновляет подцели, поэтому управление остаётся замкнутым по обратной связи и может исправить отклонение от первоначального маршрута.
Сами подцели не обязаны выглядеть как точные фотографии. В показанных примерах встречаются размытые текстуры, но сохраняются расположение предметов и направление движения. Для компонента действий геометрия сцены оказывается полезнее, чем визуальная правдоподобность каждого пикселя.
Результаты поддерживают подход, но не готовую замену стека
В симуляции ProWAM достиг 85,8% успешных попыток на LIBERO-Plus и 75,7% на случайно изменённом RoboTwin. Относительный выигрыш над сильнейшей базовой моделью доходил до 35,9%. На более длинных задачах RoboCasa365 результат составил 48,1%, а на разделе Composite-Unseen с незнакомыми составными заданиями — 18,2%.
Проверка охватывает симуляторы LIBERO, RoboTwin и RoboCasa365, а также настольные манипуляции реального робота Franka в новых сценах. Основой служит видеомодель Wan2.2-TI2V-5B; сравнение проводят с другими моделями мира и действий при принятых для каждого набора правилах. Поэтому результаты описывают роботизированные манипуляции с камерой, а не произвольное планирование в физическом мире.
Для команды, которая уже строит управление вокруг видеомодели, работа меняет архитектурный выбор. Между полным видеопрогнозом и единственной конечной целью появляется третий вариант: короткая цепочка визуальных ориентиров, встроенная в ту же модель и доступная компоненту действий без отдельного планировщика.
Практический выигрыш особенно вероятен там, где задача длится дольше одного короткого движения, а задержка крупной видеомодели мешает пересчитывать полный ролик. Предварительное обучение на видео без команд также позволяет использовать больше доступных записей до сбора робототехнических демонстраций. Однако дообучение на таких демонстрациях остаётся частью схемы: подцели не отменяют данные о том, какими командами конкретный робот достигает нужного состояния.
Менять работающий стек только по этим результатам рано. Рациональный следующий шаг — проверить подцели и кэширование внутри существующего контура управления на собственных сценах, камерах и длительных заданиях. Если основная задержка приходится на повторные запуски видеомодели, ProWAM указывает конкретное место для архитектурной оптимизации.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



