Журнал · Rit.work

AGP управляет роботом через программы, написанные на ходу

AGP передаёт общему ИИ-агенту выбор наблюдений, расчёт движений и исправление ошибок при управлении реальным роботом без обучения под конкретную задачу.

Rit.work
Студия разработки
14 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Общий мультимодальный агент смог выполнять новые физические задачи на реальном роботе без обучения под конкретную задачу или среду. AGP показал успешность не ниже 80% в семи из восьми конфигураций, хотя работа не рецензирована и числа получили сами авторы. Такой подход сокращает путь от описания задачи до прототипа, но пока не подходит для быстрого и дешёвого серийного выполнения.

Агент сам решает, что увидеть и как двигаться

Систему Agent as Policy описала группа Mengzhao Jia. В ней общий агент становится политикой управления — механизмом, который выбирает следующее действие робота по текущему состоянию задачи.

Раньше агенту обычно отдавали одну из двух ролей. Он либо заранее писал программу со всеми условиями, либо выбирал готовый навык: захватить предмет, перенести его или вставить деталь. В первом случае трудно предусмотреть физические ошибки, во втором возможности системы ограничивает набор заранее обученных навыков.

AGP оставляет агента в контуре управления на протяжении всей задачи. Он изучает инструкцию и изображения, запрашивает нужный ракурс, оценивает положение предметов, пишет локальные программы и через интерфейс передаёт роботу цели движения. Параметры модели во время работы не меняются: адаптация происходит в программах, измерениях и следующих решениях.

Подготовительный агент сначала превращает запрос в повторно используемое описание задачи. В нём фиксируются цель, исходные материалы, допустимые отклонения, критерии завершения и доступные команды. Затем отдельный исполнитель получает это описание вместе с текущей сценой и ведёт собственное рабочее пространство со снимками, скриптами и заметками.

Между моделью и оборудованием стоит программный мост. Он переводит данные камер и состояние приводов в общую систему координат, проверяет запрошенные движения и передаёт их контроллеру. Поэтому модель не управляет током в двигателях и не формирует траекторию каждого сустава: она задаёт положение захвата или целевые углы, а обычный контур управления исполняет движение в установленных пределах.

Ошибка превращается в новый шаг программы

После каждого действия агент получает новое изображение, положение робота и отчёт об исполнении. Если деталь не вошла в отверстие, он может приблизить камеру, заново рассчитать совмещение, изменить направление подхода и повторить попытку. В заранее сгенерированной программе такие развилки пришлось бы описывать до запуска.

Программы создаются прямо во время сеанса. Агент может обработать глубину с камеры, выделить область изображения, вычислить координаты предмета и собрать несколько команд в одну последовательность. Движение выполняется независимо от вывода модели, а между командами робот удерживает положение.

На конструкциях из блоков две конфигурации завершились успешно во всех попытках, а самая сложная башня — в четырёх случаях из пяти. Среднее время успешного выполнения разных задач составляло от 20,6 до 54,3 минуты. В него входили осмотр сцены, рассуждение модели, локальные вычисления, физические движения и проверка результата.

Подход проверяли на реальных настольных манипуляторах с GPT-6 Astra. Робот собирал детали по человеческому видео, строил фигуры по целевому изображению, переворачивал игральные кости, бросал предмет в ёмкость и складывал полотенце двумя манипуляторами. Каждая основная попытка начиналась в новом сеансе без репетиции в симуляторе и без опыта прошлых запусков.

Главным критерием было физическое завершение по заранее заданным правилам, а не превосходство над отдельно обученной политикой на общем наборе задач. Поэтому результаты показывают жизнеспособность архитектуры на выбранном оборудовании и сценариях, но не дают универсального сравнения с промышленными системами управления.

Планы меняются для прототипов, но не для конвейера

Для исследовательской команды AGP предлагает практичную границу системы. Геометрию, безопасность движения и обратную связь оставляют детерминированному программному слою, а агенту передают выбор наблюдений, расчёт целей и восстановление после ошибок. Так новую операцию можно задавать видео, изображением или текстом вместо сбора траекторий и отдельного обучения модели.

Для продукта с редкими и меняющимися заданиями это основание проверить агента раньше, чем начинать обучение специализированной политики. Подход особенно уместен там, где робот может потратить десятки минут на единичную операцию, а стоимость ручного программирования выше стоимости вывода модели.

Для повторяемого производства вывод другой. Расход на вывод модели составлял от 7,46 до 27,41 доллара за успешную попытку, а длительные паузы возникают не только из-за механики, но и пока агент анализирует изображения и пишет код. При высокой частоте операций заранее подготовленная программа или обученная политика по-прежнему лучше контролирует задержку и себестоимость.

Работа меняет не выбор базового контроллера, а место общего агента в архитектуре. Его можно рассматривать не только как планировщик над готовыми навыками, но и как слой, который на ходу связывает восприятие, вычисления и команды движения. Для внедрения понадобятся жёсткие пределы команд, журналирование, проверяемые критерии завершения и сценарий безопасной остановки независимо от решений модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу