Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Общий мультимодальный агент смог выполнять новые физические задачи на реальном роботе без обучения под конкретную задачу или среду. AGP показал успешность не ниже 80% в семи из восьми конфигураций, хотя работа не рецензирована и числа получили сами авторы. Такой подход сокращает путь от описания задачи до прототипа, но пока не подходит для быстрого и дешёвого серийного выполнения.
Агент сам решает, что увидеть и как двигаться
Систему Agent as Policy описала группа Mengzhao Jia. В ней общий агент становится политикой управления — механизмом, который выбирает следующее действие робота по текущему состоянию задачи.
Раньше агенту обычно отдавали одну из двух ролей. Он либо заранее писал программу со всеми условиями, либо выбирал готовый навык: захватить предмет, перенести его или вставить деталь. В первом случае трудно предусмотреть физические ошибки, во втором возможности системы ограничивает набор заранее обученных навыков.
AGP оставляет агента в контуре управления на протяжении всей задачи. Он изучает инструкцию и изображения, запрашивает нужный ракурс, оценивает положение предметов, пишет локальные программы и через интерфейс передаёт роботу цели движения. Параметры модели во время работы не меняются: адаптация происходит в программах, измерениях и следующих решениях.
Подготовительный агент сначала превращает запрос в повторно используемое описание задачи. В нём фиксируются цель, исходные материалы, допустимые отклонения, критерии завершения и доступные команды. Затем отдельный исполнитель получает это описание вместе с текущей сценой и ведёт собственное рабочее пространство со снимками, скриптами и заметками.
Между моделью и оборудованием стоит программный мост. Он переводит данные камер и состояние приводов в общую систему координат, проверяет запрошенные движения и передаёт их контроллеру. Поэтому модель не управляет током в двигателях и не формирует траекторию каждого сустава: она задаёт положение захвата или целевые углы, а обычный контур управления исполняет движение в установленных пределах.
Ошибка превращается в новый шаг программы
После каждого действия агент получает новое изображение, положение робота и отчёт об исполнении. Если деталь не вошла в отверстие, он может приблизить камеру, заново рассчитать совмещение, изменить направление подхода и повторить попытку. В заранее сгенерированной программе такие развилки пришлось бы описывать до запуска.
Программы создаются прямо во время сеанса. Агент может обработать глубину с камеры, выделить область изображения, вычислить координаты предмета и собрать несколько команд в одну последовательность. Движение выполняется независимо от вывода модели, а между командами робот удерживает положение.
На конструкциях из блоков две конфигурации завершились успешно во всех попытках, а самая сложная башня — в четырёх случаях из пяти. Среднее время успешного выполнения разных задач составляло от 20,6 до 54,3 минуты. В него входили осмотр сцены, рассуждение модели, локальные вычисления, физические движения и проверка результата.
Подход проверяли на реальных настольных манипуляторах с GPT-6 Astra. Робот собирал детали по человеческому видео, строил фигуры по целевому изображению, переворачивал игральные кости, бросал предмет в ёмкость и складывал полотенце двумя манипуляторами. Каждая основная попытка начиналась в новом сеансе без репетиции в симуляторе и без опыта прошлых запусков.
Главным критерием было физическое завершение по заранее заданным правилам, а не превосходство над отдельно обученной политикой на общем наборе задач. Поэтому результаты показывают жизнеспособность архитектуры на выбранном оборудовании и сценариях, но не дают универсального сравнения с промышленными системами управления.
Планы меняются для прототипов, но не для конвейера
Для исследовательской команды AGP предлагает практичную границу системы. Геометрию, безопасность движения и обратную связь оставляют детерминированному программному слою, а агенту передают выбор наблюдений, расчёт целей и восстановление после ошибок. Так новую операцию можно задавать видео, изображением или текстом вместо сбора траекторий и отдельного обучения модели.
Для продукта с редкими и меняющимися заданиями это основание проверить агента раньше, чем начинать обучение специализированной политики. Подход особенно уместен там, где робот может потратить десятки минут на единичную операцию, а стоимость ручного программирования выше стоимости вывода модели.
Для повторяемого производства вывод другой. Расход на вывод модели составлял от 7,46 до 27,41 доллара за успешную попытку, а длительные паузы возникают не только из-за механики, но и пока агент анализирует изображения и пишет код. При высокой частоте операций заранее подготовленная программа или обученная политика по-прежнему лучше контролирует задержку и себестоимость.
Работа меняет не выбор базового контроллера, а место общего агента в архитектуре. Его можно рассматривать не только как планировщик над готовыми навыками, но и как слой, который на ходу связывает восприятие, вычисления и команды движения. Для внедрения понадобятся жёсткие пределы команд, журналирование, проверяемые критерии завершения и сценарий безопасной остановки независимо от решений модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



