Журнал · Rit.work

AGFT согласует зрение, команды и действия робота

AGFT добавляет в VLA-политику явное согласование трёх типов данных и заменяет диффузионное восстановление действий на более короткий детерминированный процесс.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель управления роботом научили согласовывать изображение, текстовую команду и движение, чтобы точнее выполнять новые задания и быстрее строить последовательность действий. В нерецензированном препринте Shanghai Jiao Tong University, Sun Yat-sen University и Nanyang Technological University, где все числа получили сами авторы, AGFT обошла базовую Dita и почти сохранила качество при сокращении числа шагов вывода вдвое. Для команд, которые строят VLA-политики, работа предлагает отдельную проверяемую гипотезу: при адаптации модели стоит обучать не только генератор действий, но и связь действий с каждым входным сигналом.

Действие становится центром согласования модальностей

Модели VLA объединяют зрение, язык и управление роботом. Типичная схема кодирует изображение и инструкцию, а затем передаёт их в головку, которая строит движение. Проблема возникает, когда зрительный признак указывает на один объект, текстовый — на другой смысл, а представление действия остаётся слабо связано с обоими.

AGFT делает эту связь частью функции потерь. Совпадающими считаются признаки изображения, команды и действия из одной демонстрационной траектории в один момент времени. Примеры из других траекторий или моментов выступают отрицательными парами: модель сближает согласованные представления и удерживает несогласованные дальше заданной границы.

Основной вес получают пары «текст — действие» и «изображение — действие». Связь изображения с текстом служит дополнительным ограничением. Такая конструкция соответствует задаче управления: недостаточно распознать предмет и понять команду, если итоговое движение не отражает ни то ни другое.

Языковые признаки извлекает замороженный CLIP, зрительные — DINOv2, который дообучается вместе с политикой. Q-Former отбирает зрительные признаки с учётом инструкции, после чего причинный Transformer обрабатывает команду, изображение, момент траектории и зашумлённое действие. Действие включает перемещение, вращение и состояние захвата.

Теоретическая часть связывает среднее расстояние между тремя представлениями с границами ошибки при обучении. Чем ближе изображение, команда и действие в общем пространстве, тем уже эти границы. Вывод опирается на идеализированные свойства последнего линейного слоя и статистическую симметрию модальностей, поэтому сам по себе не гарантирует такой же эффект в другой архитектуре.

Сопоставление потоков сокращает путь от шума к движению

Вместо диффузионного восстановления AGFT использует сопоставление потоков (flow matching). Во время обучения Transformer предсказывает направление, которое переводит случайный шум в целевую последовательность действий. При выводе модель решает детерминированное дифференциальное уравнение и постепенно движется вдоль выученного поля.

На LIBERO-Long базовая Dita успешно выполняла 63,8% заданий, а полная конфигурация AGFT — 75,2%. При пяти шагах интегрирования результат составил 73,8%, тогда как десять шагов дали максимум. Дальнейшее увеличение почти не помогало.

Разбор компонентов показывает, что улучшение нельзя объяснить только новым генератором действий. Отдельное согласование действия с текстом или изображением повышало результат, их совместное использование работало лучше, а связь текста с изображением давала меньшую прибавку. Значит, полезный сигнал сосредоточен именно вокруг моторного выхода.

Проверки охватывают LIBERO и CALVIN, включая длинные задания LIBERO-Long. В качестве основной точки отсчёта использовали дообучение Dita с диффузионной целью; также AGFT сопоставляли с другими VLA-моделями. Отдельные эксперименты меняли функцию согласования, число шагов вывода и набор дообучаемых кодировщиков.

Меняет ли AGFT планы разработки VLA-политик

Работа не требует сразу менять всю архитектуру. Контрастивное согласование можно проверить поверх существующего Transformer, если обучающие демонстрации синхронизируют кадры, команды и действия. Дополнительная ручная разметка пар не нужна: положительные и отрицательные примеры определяются по принадлежности к траектории и моменту времени.

Для проекта с диффузионной головкой разумный следующий эксперимент — заменить цель обучения действия на сопоставление потоков, а затем отдельно включить связи «текст — действие» и «изображение — действие». Такой порядок отделит выигрыш от более короткого вывода от выигрыша, который даёт согласование представлений.

Результаты также предостерегают от дообучения всех кодировщиков одновременно. В основной конфигурации языковой CLIP оставался замороженным, а зрительный DINOv2 адаптировался к робототехническим кадрам. Для продуктовой команды это означает, что стабильный языковой слой может оказаться полезнее полной свободы обучения, особенно при небольшом наборе специализированных инструкций.

AGFT пока обосновывает ветку экспериментов, а не безусловную замену действующей политики. Переносимость вывода нужно проверять на собственных сенсорах, наборах действий и длине управляющего цикла: опубликованные сравнения относятся к структуре и задачам LIBERO и CALVIN.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу