Журнал · Rit.work

AALT ищет демонстрации, которые соединяют сразу несколько задач

AALT оценивает демонстрации по числу новых маршрутов между состояниями и сокращает объём примеров, которые нужно запрашивать у эксперта.

Rit.work
Студия разработки
17 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Короткие экспертные демонстрации можно выбирать по тому, сколько новых маршрутов они собирают из уже изученных действий, а не только по объёму новой информации для модели. В нерецензированном препринте, где все числа получили сами авторы, Maxwell J. Jacobson, Ahmed H Qureshi и Yexiang Xue показали, что AALT расширил покрытие с 42 из 72 задач до полного после трёх демонстраций общей длиной пять переходов. Такой подход может сократить сбор примеров в системах, где задачи отличаются начальным состоянием и целью, но используют общие промежуточные действия.

Почему полезнее показать мост, а не целую задачу

Активное обучение по демонстрациям позволяет модели самой выбирать, какой пример запросить у эксперта. Обычные методы оценивают, насколько новый пример уменьшит неопределённость модели относительно действий эксперта. Поэтому они могут предпочесть сложную или незнакомую полную траекторию, даже если она пригодится только для одной задачи.

AALT оценивает другое: сколько пар «начальное состояние — цель» станут достижимыми после добавления демонстрации. Если модель уже умеет добираться до одного промежуточного состояния, а из другого знает пути к нескольким целям, ей достаточно показать короткий переход между ними. Авторы называют такой переход мостом.

Сначала AALT кодирует состояния из исходных демонстраций и объединяет близкие состояния в узлы. Узлами становятся начала и концы траекторий, а также места, где известные пути сходятся или расходятся. Показанные действия образуют направленные рёбра между узлами, и для каждого ребра модель оценивает вероятность успешного исполнения.

Затем метод перебирает отсутствующие рёбра. Для каждого кандидата он временно добавляет мост в карту и вычисляет, насколько вырастет средняя надёжность лучшего маршрута по целевому набору задач. Задачи учитываются с весами из их целевого распределения, поэтому часто встречающийся маршрут влияет на выбор сильнее редкого.

Запрос получает мост с наибольшим ожидаемым приростом связности. Эксперт видит конкретные исходное и конечное состояния, а не внутренние представления модели. После успешной демонстрации AALT обновляет общую модель действий, надёжность рёбер и оценки оставшихся кандидатов.

При выполнении задачи система сначала строит маршрут по получившейся карте, а затем проходит его по частям. Низкоуровневые действия для каждого перехода создаёт общая диффузионная модель. Карта отвечает за композицию известных навыков, а модель действий — за исполнение очередного участка.

Связность оказалась важнее формата запроса

Сильнейший базовый вариант достиг успешности 88,6% после 20 запросов, которые содержали в среднем 98 переходов. Он выбирал случайные мосты из того же набора кандидатов, поэтому разницу нельзя объяснить одним лишь разрешением запрашивать короткие переходы.

Первый выбранный AALT мост сразу открыл 12 новых задач. Все добавленные мосты вместе сделали доступными 30 ранее нерешённых задач, причём некоторые итоговые маршруты использовали несколько новых переходов последовательно. Это и есть эффект композиции: один пример не заменяет отдельную траекторию, а подключает целый уже изученный фрагмент карты.

Вариант AMF-Bridge работал с той же картой, контроллером и кандидатами, но ранжировал запросы по ожидаемой информации о политике эксперта. Он чаще оставлял задачи без маршрута, чем сталкивался с ошибкой исполнения уже найденного пути. Значит, узким местом в эксперименте был выбор недостающих связей, а не только качество низкоуровневой модели.

Проверка охватывает одну симулированную среду с роботом UR5e, который по изображению сверху переставляет контейнеры и выполняет заказы с заданной последовательностью. Действия были дискретными, среда заранее отсеивала недопустимые варианты, а роль эксперта выполнял поиск A* с доступом к символьному состоянию полки. Сравнивали AALT, полные запросы AMF, AMF на мостах и случайный выбор мостов при общем исходном наборе демонстраций.

Когда пересматривать план сбора демонстраций

Работа меняет план эксперимента, если продукт решает много задач из разных начальных состояний, а их траектории разделяют префиксы, промежуточные состояния или завершающие действия. В таком случае бюджет демонстраций стоит распределять не только по неопределённости модели, но и по тому, сколько востребованных маршрутов откроет каждый пример.

Для прототипа не обязательно воспроизводить всю архитектуру AALT. Сначала можно представить известные состояния и переходы графом, отметить пары без маршрута и оценить, какие недостающие связи подключат больше уже работающих ветвей. Распределение реальных запросов или заказов должно задавать веса: иначе система будет одинаково ценить редкие и основные сценарии.

Полная схема требует устойчиво находить общие промежуточные состояния, сопоставлять с ними новые наблюдения и превращать выбранный мост в понятный запрос эксперту. Ошибка на этом уровне искажает всю оценку связности. Кроме того, AALT жадно выбирает лучший следующий мост и не просчитывает, какая последовательность запросов даст лучший итог при всём бюджете.

Поэтому результат пока поддерживает смену критерия отбора в контролируемой среде, а не даёт готовую оценку экономии для физического робота или бизнес-процесса. Практический следующий шаг — сравнить два журнала запросов на собственных сценариях: один ранжировать по неопределённости модели, другой — по приросту достижимых и востребованных задач.

Источники

Иллюстрация: рисунок из статьи «Missing Bridges: Composition-Aware Active Imitation Learning», Maxwell J. Jacobson, Ahmed H Qureshi, Yexiang Xue, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу