Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель управления роботом научили согласовывать изображение, текстовую команду и движение, чтобы точнее выполнять новые задания и быстрее строить последовательность действий. В нерецензированном препринте Shanghai Jiao Tong University, Sun Yat-sen University и Nanyang Technological University, где все числа получили сами авторы, AGFT обошла базовую Dita и почти сохранила качество при сокращении числа шагов вывода вдвое. Для команд, которые строят VLA-политики, работа предлагает отдельную проверяемую гипотезу: при адаптации модели стоит обучать не только генератор действий, но и связь действий с каждым входным сигналом.
Действие становится центром согласования модальностей
Модели VLA объединяют зрение, язык и управление роботом. Типичная схема кодирует изображение и инструкцию, а затем передаёт их в головку, которая строит движение. Проблема возникает, когда зрительный признак указывает на один объект, текстовый — на другой смысл, а представление действия остаётся слабо связано с обоими.
AGFT делает эту связь частью функции потерь. Совпадающими считаются признаки изображения, команды и действия из одной демонстрационной траектории в один момент времени. Примеры из других траекторий или моментов выступают отрицательными парами: модель сближает согласованные представления и удерживает несогласованные дальше заданной границы.
Основной вес получают пары «текст — действие» и «изображение — действие». Связь изображения с текстом служит дополнительным ограничением. Такая конструкция соответствует задаче управления: недостаточно распознать предмет и понять команду, если итоговое движение не отражает ни то ни другое.
Языковые признаки извлекает замороженный CLIP, зрительные — DINOv2, который дообучается вместе с политикой. Q-Former отбирает зрительные признаки с учётом инструкции, после чего причинный Transformer обрабатывает команду, изображение, момент траектории и зашумлённое действие. Действие включает перемещение, вращение и состояние захвата.
Теоретическая часть связывает среднее расстояние между тремя представлениями с границами ошибки при обучении. Чем ближе изображение, команда и действие в общем пространстве, тем уже эти границы. Вывод опирается на идеализированные свойства последнего линейного слоя и статистическую симметрию модальностей, поэтому сам по себе не гарантирует такой же эффект в другой архитектуре.
Сопоставление потоков сокращает путь от шума к движению
Вместо диффузионного восстановления AGFT использует сопоставление потоков (flow matching). Во время обучения Transformer предсказывает направление, которое переводит случайный шум в целевую последовательность действий. При выводе модель решает детерминированное дифференциальное уравнение и постепенно движется вдоль выученного поля.
На LIBERO-Long базовая Dita успешно выполняла 63,8% заданий, а полная конфигурация AGFT — 75,2%. При пяти шагах интегрирования результат составил 73,8%, тогда как десять шагов дали максимум. Дальнейшее увеличение почти не помогало.
Разбор компонентов показывает, что улучшение нельзя объяснить только новым генератором действий. Отдельное согласование действия с текстом или изображением повышало результат, их совместное использование работало лучше, а связь текста с изображением давала меньшую прибавку. Значит, полезный сигнал сосредоточен именно вокруг моторного выхода.
Проверки охватывают LIBERO и CALVIN, включая длинные задания LIBERO-Long. В качестве основной точки отсчёта использовали дообучение Dita с диффузионной целью; также AGFT сопоставляли с другими VLA-моделями. Отдельные эксперименты меняли функцию согласования, число шагов вывода и набор дообучаемых кодировщиков.
Меняет ли AGFT планы разработки VLA-политик
Работа не требует сразу менять всю архитектуру. Контрастивное согласование можно проверить поверх существующего Transformer, если обучающие демонстрации синхронизируют кадры, команды и действия. Дополнительная ручная разметка пар не нужна: положительные и отрицательные примеры определяются по принадлежности к траектории и моменту времени.
Для проекта с диффузионной головкой разумный следующий эксперимент — заменить цель обучения действия на сопоставление потоков, а затем отдельно включить связи «текст — действие» и «изображение — действие». Такой порядок отделит выигрыш от более короткого вывода от выигрыша, который даёт согласование представлений.
Результаты также предостерегают от дообучения всех кодировщиков одновременно. В основной конфигурации языковой CLIP оставался замороженным, а зрительный DINOv2 адаптировался к робототехническим кадрам. Для продуктовой команды это означает, что стабильный языковой слой может оказаться полезнее полной свободы обучения, особенно при небольшом наборе специализированных инструкций.
AGFT пока обосновывает ветку экспериментов, а не безусловную замену действующей политики. Переносимость вывода нужно проверять на собственных сенсорах, наборах действий и длине управляющего цикла: опубликованные сравнения относятся к структуре и задачам LIBERO и CALVIN.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



