Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Qisong Guo и соавторы представили DiDrive — диффузионную модель управления автомобилем, обучаемую по готовым поездкам без взаимодействия со средой; работа опубликована как препринт, не проходивший рецензирования. В плотном сценарии CARLA с 60 окружающими автомобилями авторы измерили 85% успешных поездок против 77% у Diffusion-QL. Результат важен командам, которые рассматривают офлайн-обучение с подкреплением для планирования движения, но должны контролировать действия вне обучающего распределения.
Что сделали
Офлайн-обучение с подкреплением строит стратегию управления на статическом наборе переходов между состояниями, действиями и результатами. Его проблема — сдвиг распределения: модель может выбрать действие, которого почти не было в наборе, а функция ценности ошибочно оценит его как выгодное. Диффузионные модели дополнительно способны генерировать несколько вариантов поведения, но это не устраняет риск выхода за границы обучающих данных.
DiDrive разделяет задачу на представление дорожной сцены и выбор действия. Архитектура RHDif усиливает признаки локальной опасности — близкие автомобили, препятствия и отклонение от полосы — и одновременно подавляет фоновую информацию. Механизм 3DICE направляет генерацию по действиям из обучающего набора, стабилизирует обновление модели при редких крупных штрафах за аварии и ранжирует несколько кандидатов ансамблем моделей.
Разбор компонентов показывает, откуда берётся часть результата: без локального риск-ориентированного кодировщика доля столкновений по замерам авторов выросла с 13% до 18%. Это связывает итоговую успешность не только с диффузионной генерацией, но и с отдельной обработкой опасных объектов.
Что это значит
Работа показывает возможную архитектуру для систем, где нельзя безопасно собирать опыт методом проб и ошибок. Вместо поиска действия с максимальной прогнозируемой ценностью DiDrive старается оставаться внутри области, представленной историческими поездками, и отдельно выделяет критичные элементы сцены. Такой подход нацелен на две причины сбоев базовых алгоритмов: завышенную оценку незнакомых действий и потерю локального риска среди многомерных входных данных.
Ограничения. Авторы проверяли DiDrive на статических данных и замкнутых поездках только в симуляторе CARLA, поэтому работа не показывает перенос результатов на физический автомобиль. Сравнение с IQL, CQL и Diffusion-QL охватывает качество управления, но не содержит замеров задержки вывода или требований к оборудованию. Авторы отдельно указывают, что многошаговое устранение шума увеличивает задержку и может мешать высокочастотному управлению.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



