Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Неясные сбои робота научились превращать в проверенные примеры того, как продолжить задачу после ошибки. Loan Bernat и коллеги представили MAGMA-GEN: подход улучшил успешность задач и восстановление после сбоев по сравнению с дистилляцией и ремонтом траекторий, хотя работа не рецензирована и все её числа получены самими авторами. Для робототехнических команд это предлагает ещё один источник обучающих данных — собственные неудачные запуски системы.
Почему не каждый неудачный прогон указывает на ошибку планирования
В иерархической робототехнической системе верхний уровень выбирает смысловые действия: взять предмет, переместить его или перейти к следующему этапу. Нижний уровень исполняет эти решения через физические навыки, результат которых не всегда предсказуем.
Если задача сорвалась, причина неочевидна. Планировщик мог принять неверное решение, робот мог видеть сцену не полностью, а корректно выбранное действие могло не получиться из-за физического исполнения. Конечное состояние показывает, что прогон не удался, но не объясняет, какой компонент следует исправлять.
Обычному обучению с учителем для таких ситуаций нужны примеры правильного восстановления. Их можно собирать вручную, но тогда человек должен разметить действия для множества промежуточных состояний. Обучение с подкреплением тоже сталкивается с проблемой: награда приходит далеко после решения, которое вызвало сбой, поэтому системе трудно связать итог с конкретным шагом.
MAGMA-GEN собирает данные на прогонах текущего робота. Благодаря этому обучающие примеры отражают не заранее составленный набор ошибок, а состояния, в которые попадает сама система при выполнении длинных задач.
Исправление проверяют повторным исполнением
После неудачного прогона привилегированный наставник, которому доступна дополнительная информация, предполагает, на каком раннем решении возникла ошибка. Затем он предлагает локальное исправление или действие для восстановления. Такой наставник может ошибаться, поэтому его предложение ещё не становится обучающим примером.
Систему возвращают в то же состояние и при сопоставимых условиях исполняют предложенный вариант. Пример сохраняют, только если новое действие улучшает дальнейший ход задачи. Это контрфактический повторный запуск: система сравнивает фактическую неудачную ветку с альтернативой, которая начинается из той же точки.
Главная деталь подхода — повторный запуск проверяет полезность исправления, а не истинность диагноза. Наставник может неверно объяснить причину сбоя, но предложить действие, которое действительно помогает продолжить задачу. MAGMA-GEN отбрасывает неподтверждённые предположения и оставляет пары «состояние — полезное восстановление».
Подход проверяли на интерактивных задачах длительного манипулирования с меняющимися условиями — в симуляции и на реальном роботе. Его сравнивали с дистилляцией и ремонтом траекторий; поскольку этот материал подготовлен по абстракту, величину выигрыша, наборы задач и точную схему повторных запусков восстановить нельзя.
Планы меняются в контуре сбора данных, а не в архитектуре робота
MAGMA-GEN не требует заменять иерархическую систему единым планировщиком. Изменение касается контура обучения: команда должна сохранять неудачные состояния, предлагать варианты восстановления, воспроизводить условия и измерять дальнейший прогресс. Фейл превращается в данные только после проверки действием.
Лучше всего этот принцип ложится на разработку, где состояние можно воспроизвести. В симуляции команда может возвращаться к сохранённой сцене. На физической установке потребуется процедура, которая восстанавливает расположение объектов и другие условия достаточно точно для содержательного сравнения.
Ещё одна зависимость — привилегированный наставник. Ему нужна информация, которой может не быть у рабочего агента: например, более полное представление состояния или возможность оценить раннее решение задним числом. Поэтому при планировании системы стоит отдельно определить, какой компонент будет предлагать исправления и по какому признаку прогон считается улучшившим дальнейший результат.
Работа меняет планы команд, которые уже собирают журналы сбоев, но используют их только для отладки. MAGMA-GEN предлагает добавить проверяемую ветку генерации обучающих данных: воспроизвести проблемное состояние, испытать исправление и вернуть подтверждённый пример в следующий цикл обучения. Если состояния нельзя повторять или прогресс нельзя измерить до завершения всей задачи, внедрение потребует сначала перестроить испытательный контур.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



