Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Робота научили самому решать, когда действовать автономно, когда принимать автоматическую помощь и когда возвращать управление обучаемой модели. Поскольку препринт Nanyang Technological University не прошёл рецензирование, все числа в нём получены самими авторами: средняя успешность достигла 89,67%, а человек управлял роботом в 0,77% шагов. Такой агент может снять с оператора постоянное наблюдение за обучением, но не отменяет автоматические корректировки и внешний контур безопасности.
Как агент распределяет контроль между моделью и помощниками
UniIntervene++ работает поверх модели, которая обучается с подкреплением прямо на физическом роботе. Агент вмешательства выбирает один из трёх режимов: передать управление текущей модели, скорректировать движение по успешной демонстрации или запустить CodePolicy — составленный для задачи набор движений, команд захвату и ожиданий.
Режимы выполняются не по одному управляющему шагу, а до собственного условия завершения. Поэтому выбор оформлен как полумарковский процесс: агент сравнивает действия разной длительности и принимает новое решение только на их границах. За ненужную или слишком долгую помощь он получает штраф, а успешное выполнение задачи повышает ценность выбранного режима.
Доступны не все варианты сразу. Коррекция по траектории требует достижимой точки на эталонном пути, а CodePolicy — пригодных данных восприятия и выполнимого плана. Маска доступности не даёт агенту выбирать режим, который невозможно применить в текущем состоянии.
Надёжный помощник может захватить управление надолго и скрыть, что основная модель уже стала лучше. UniIntervene++ поэтому периодически запускает её без помощи и измеряет продвижение вдоль эталонной траектории, отклонение от неё и остановки. Успешные проверки постепенно удлиняют автономные отрезки, а опасное отклонение или вмешательство человека сокращает их.
Опыт помощников не пропадает после переключения режима. Переходы, выполненные коррекцией траектории, CodePolicy или человеком, попадают в буфер обучения основной модели. Улучшенная модель затем создаёт новые результаты для агента вмешательства, поэтому оба компонента влияют друг на друга через собранный опыт, но используют отдельные сети и цели обучения.
Помощь остаётся частой, но перестаёт быть человеческой
Метод проверили на пяти задачах: переносе кольца, вставке трубки и USB, протирании доски и складывании полотенца. Все опыты прошли на одном манипуляторе UR7e с захватом Robotiq; сравнивали с HIL-SERL, AutoSERL и UniIntervene. Лучший из этих вариантов уступил UniIntervene++ как минимум 6 процентных пунктов по средней доле успешных попыток.
Низкая доля ручного управления не означает, что робот учился почти без поддержки. Автоматические режимы или человек контролировали 56,04% шагов. Результат показывает прежде всего замену регулярной работы оператора программными помощниками, а не отказ от вмешательств как таковых.
На переносе кольца доля управления основной моделью выросла с 35,78% до 90,51% по мере обучения. Агент не просто выбрал удобного помощника в начале эксперимента, а вернул управление модели, когда проверки подтвердили её прогресс.
В разборе компонентов обучаемое распределение режимов оказалось лучше фиксированных вероятностей. CodePolicy внёс больший вклад, чем коррекция по демонстрационной траектории: он мог не только вернуть захват на прежний путь, но и выполнить предметное восстановление — например, разжать пустой захват, снова выровнять его и повторить попытку взять кольцо. Отдельный вклад периодических автономных проверок в работе не изолировали.
Когда подход меняет архитектуру роботизированного обучения
Работа меняет планы команд, у которых оператор сейчас следит за каждой попыткой и вручную исправляет повторяющиеся ошибки. Вместо единственного переключателя «модель или человек» можно заложить отдельный агент, который выбирает среди нескольких автоматических способов помощи и переоценивает их по мере обучения основной модели.
Для переноса подхода нужны не только алгоритм распределения контроля, но и сами помощники. Коррекции требуется успешная траектория, а CodePolicy опирается на восприятие объектов и написанные для задачи примитивы. Если таких контроллеров нет или они не создают полезный опыт, показанное сокращение ручной работы напрямую не переносится.
Практический вывод касается и метрик. Доли человеческих вмешательств недостаточно: она может падать, пока робот остаётся зависимым от автоматической поддержки. Отдельно стоит измерять общий объём помощи, успешность основной модели без неё и то, возвращает ли агент модели больше контроля по мере обучения.
Границы эксперимента задают масштаб вывода: один робот, набор манипуляционных задач с редкой наградой и заранее подготовленные способы автоматической помощи. Человек при этом остаётся внешним средством аварийного вмешательства, а не ещё одним режимом агента. Поэтому UniIntervene++ даёт основание прототипировать автоматическое распределение помощи, но не заменять им существующий контур безопасности.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



