Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Планировщик может не достичь доступной цели, если на каждом коротком шаге старается приблизиться только к ней. В препринте команды Tsinghua University, который не проходил рецензирование и где все числа получили сами авторы, промежуточная цель повысила средний успех поиска действий с 9,2% до 59,8%. Это позволяет сначала менять функцию оценки, а не переобучать модель мира или увеличивать вычислительный бюджет.
Почему правильный прогноз ведёт к неправильному действию
Визуальная модель мира предсказывает, как изменится наблюдаемая сцена после предложенной последовательности действий. Обычный планировщик кодирует текущее изображение и изображение цели, перебирает короткие последовательности, а затем выбирает ту, чей предсказанный результат ближе всего к финалу.
Проблема возникает, когда допустимый маршрут сначала уводит объект от цели. Короткий поиск не видит весь путь и отвергает первый полезный манёвр: бездействие сохраняет прежнюю дистанцию, а движение временно её увеличивает.
Работа показывает это на математической конструкции с точной динамикой и глобально оптимальным поиском. Планировщик безошибочно предсказывает последствия всех доступных действий, но всё равно бесконечно выбирает нулевое действие. Последовательность промежуточных точек на том же маршруте выводит его из этого состояния.
Значит, качество управления определяет не только точность модели. Даже правильные прогнозы бесполезны, если критерий выбора предпочитает действие, которое хорошо выглядит на коротком отрезке, но не продолжает маршрут.
Как Anchored Planning выбирает следующий ориентир
Предложенный метод Anchored Planning ищет в записанном опыте маршрут, начало которого похоже на текущую сцену, а конец — на желаемую. Целью для ближайшего планирования становится не конец записи, а одно из ранних наблюдений этого маршрута.
Модель LeWM при этом остаётся замороженной: её кодировщик, предсказатель и нормализацию действий не меняют. Планировщик лишь оценивает кандидатов относительно другого ориентира, исполняет короткий блок, получает новое наблюдение и повторяет процедуру.
Метод работает с двумя видами памяти. Если в записях есть только изображения, действия синтезирует поиск CEM — он постепенно сдвигает распределение кандидатов к вариантам с лучшей оценкой. Если вместе с изображениями сохранены действия, планировщик извлекает несколько подходящих блоков и с помощью модели проверяет, какой из них лучше сработает из текущего состояния.
По мере исполнения Anchored Planning сокращает временной отрезок, который сопоставляет с записанным маршрутом. В начале нужен опыт, связывающий далёкие состояния, а рядом с целью полезнее короткие записи. Сам ближайший ориентир при этом остаётся достижимым для короткого поиска.
Авторы также обучили отдельную модель предсказывать промежуточную цель. Она точнее восстанавливала следующий записанный результат, но в среднем управляла хуже, чем выбор реального наблюдения из памяти. Ошибка прогноза следующего состояния и пригодность ориентира для управления оказались разными характеристиками.
Меняет ли работа планы продуктовой команды
Метод проверяли на Cube, PushT, Reacher и TwoRoom с отдельной предобученной LeWM для каждой задачи. Для каждой среды использовали 128 пар начала и цели, разделённых 100–150 действиями, а также старты с искусственным смещением. Успех измеряли по физическому состоянию среды, а не по близости скрытых представлений.
При выборе среди записанных действий промежуточный ориентир поднял средний успех со стандартных стартов с 67,0% до 83,8%. Он улучшил результат на всех проверенных задачах и при обоих видах старта. Дополнительный поиск к финальной цели не дал того же эффекта: уже две итерации CEM с промежуточным ориентиром обошли 30 итераций с прямой оценкой цели.
Для команды, которая строит управление поверх визуальной модели мира, это меняет порядок экспериментов. Если короткий планировщик застревает на длинных заданиях, сначала стоит разделить прогноз динамики и выбор ориентира: оставить модель неизменной, взять промежуточные состояния из накопленных траекторий и сравнить их с прямой оценкой финала.
Подход особенно применим там, где уже есть последовательности наблюдений, но не хватает разметки действий или бюджета на новое обучение. Он не требует отдельного генератора подцелей, однако зависит от того, содержит ли память маршрут, похожий одновременно на текущую ситуацию и нужный результат.
Работа не доказывает, что промежуточные наблюдения заменят иерархическое планирование в других семействах моделей. Она точнее указывает место диагностики: неудача замороженной модели мира ещё не означает, что модель плохо предсказывает. Иногда планировщик просто измеряет расстояние не до той точки.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



