Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Одну политику управления научили подходить к разным предметам, захватывать их и поворачивать в нужное положение без демонстраций на самом роботе. В препринте Applied Intuition, который не проходил рецензирование и приводит замеры самих авторов, X-Reset поднял долю успешных поворотов с 11,0 до 66,6%. Для разработки это означает, что человеческие записи можно использовать как подсказку при исследовании среды, а не как эталон поведения робота.
Демонстрация задаёт старт, а не траекторию
При обучении через имитацию робот получает человеческое или роботизированное движение как образец, который нужно повторить. Такой подход плохо переносится между разными конструкциями: человеческая кисть и робот отличаются суставами, диапазонами движения и механикой контакта. Геометрически похожая траектория может не удержать предмет или привести к столкновению.
X-Reset извлекает из записи положения человеческой руки и предмета, а затем подбирает соответствующую конфигурацию робота. Получившиеся состояния не становятся правильными действиями. Они служат точками, в которые симулятор иногда помещает робота при начале нового эпизода обучения.
Перед этим система отбрасывает конфигурации, которые нарушают пределы суставов или оказываются нестабильными в физическом симуляторе. Например, после грубого переноса пальцы могут проникнуть внутрь предмета, а предмет — сразу выпасть. Оставшиеся состояния образуют набор стартовых поз рядом с захватом, удержанием и успешным поворотом.
Дальше робот учится самостоятельно. Политика получает положение своих суставов, набор точек на поверхности предмета, его текущее и целевое положение, а также историю взаимодействия. Общая функция награды поощряет приближение к предмету и достижение цели, сглаживает движения и штрафует опасные состояния.
Человеческая запись не нужна при выполнении задачи и не ограничивает способ захвата. Если предмет сдвинулся или цель изменилась, политика ищет подходящее действие из текущего состояния, а не пытается вернуться на записанную траекторию. В этом главное отличие X-Reset от слежения за эталонным движением.
Сбросы делают сигнал награды достижимым
Метод проверяли на 20 жёстких предметах DexYCB и трёх конструкциях робота: многопалой кисти на разных манипуляторах и параллельном захвате. Для каждой конструкции обучали отдельную универсальную политику. Успехом считали положение предмета с ошибкой по точкам поверхности не более 2 см.
Без специальных стартовых состояний объектно-центрическая награда редко приводит робота к удачному захвату: сигнал об успешном повороте остаётся слишком далеко от случайных действий. X-Reset начинает часть эпизодов в полезных областях пространства состояний. Оттуда политика быстрее обнаруживает успешное действие, после чего награда распространяется на более ранние этапы — приближение и захват.
Авторы также сравнили общую объектную награду с вариантом, который дополнительно тянет пальцы робота к положению человеческих пальцев. У второго варианта успех вырос с 42,1 до 59,6%, но после добавления X-Reset менее предписывающая объектная награда показала лучший итог. Стартовые состояния помогли исследованию среды, а отсутствие требования копировать руку оставило роботу свободу подобрать захват под собственную механику.
Прямое воспроизведение перенесённой человеческой траектории работало хуже обучения. Это подтверждает практическую роль демонстрации: она указывает, где искать полезные состояния, но не даёт надёжную последовательность команд для другой конструкции.
Когда X-Reset меняет план разработки
Подход меняет план команды, если основной расход приходится на телоуправление многопалым роботом и сбор точных демонстраций. Вместо записи команд конкретной установки можно построить конвейер, который восстанавливает позы руки и предмета из человеческих записей, переносит их в симулятор и фильтрует физически неустойчивые состояния. Функцию награды и архитектуру политики при этом можно сохранить общей для набора предметов.
Предварительное обучение также оказалось полезным для новых объектов. После обучения на DexYCB политику проверили на 12 предметах EBench, для которых не использовали человеческие демонстрации. Предварительно обученная и затем дообученная политика достигла 85,9% успеха против 39,1% у политики, которая начинала обучение на EBench с нуля при том же бюджете.
Это делает X-Reset кандидатом на базовую политику для семейства задач, а не только на способ обучить один захват. Команда может накопить человеческие взаимодействия с доступными предметами, обучить общую моторику, а затем адаптировать её к новому ассортименту уже без отдельной записи движений.
Границы работы задаёт сама постановка. Эксперименты охватывают приближение, захват и изменение положения жёсткого предмета; политика использует точную оценку его позы. На настоящем роботе она переносилась из симуляции без дообучения на знакомый и новые предметы, но основной причиной сбоев стала ошибка системы, которая отслеживает положение объекта.
Поэтому X-Reset пока не отменяет конвейер восприятия и не решает длинные последовательности действий. Для продукта с жёсткими предметами и известной целью он может сократить потребность в роботизированных демонстрациях. Для деформируемых объектов, шарнирных механизмов или задач без надёжного отслеживания позы результаты работы ещё не дают основания менять выбранный подход.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



