Журнал · Rit.work

Дальние цели учат политику игнорировать цель

Увеличение горизонта переобозначения целей может ухудшить даже достижение близких подцелей, а сохранить чувствительность политики помогает перенос якобианов.

Rit.work
Студия разработки
8 октября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Политика, обученная на далёких целях, может хуже достигать даже близких подцелей, потому что постепенно перестаёт учитывать саму цель. В работе UCLA успех в одной задаче вырос с 18 до 74 после переноса чувствительности короткогоризонтной политики; это нерецензированный препринт, и все числа получили сами авторы. Для команд, которые обучают универсальных роботов на готовых траекториях, горизонт переобозначения целей становится отдельным параметром модели, а не техническим следствием длины задачи.

Почему далёкая цель перестаёт подсказывать следующее действие

При обучении политики, обусловленной целью, одну траекторию можно использовать повторно: взять текущее состояние и назначить целью одно из состояний, достигнутых позже. Так данные без наград превращаются в примеры вида «из этого состояния двигаться к этой цели таким действием».

Проблема возникает, когда целевое состояние отстоит далеко. Один и тот же итог часто допускает разные первые действия. Чем больше промежуточных шагов, тем слабее цель указывает, что нужно сделать прямо сейчас.

Работа описывает это через условную взаимную информацию — меру того, сколько сведений о действии добавляет цель, если текущее состояние уже известно. При марковском поведении эта величина не растёт вместе с расстоянием до переобозначенной цели. Она строго уменьшается, когда разные траектории сходятся в одном будущем состоянии, хотя требуют разных действий в начале.

Такое схождение появляется и из-за исправленных ошибок, и из-за нескольких правильных планов. При перекладывании трёх объектов возможны до шести порядков действий, которые заканчиваются одной конфигурацией. Конечная цель поэтому почти ничего не говорит о том, какой объект брать первым.

Обычное клонирование поведения в этой ситуации находит простой путь: сильнее опирается на текущее состояние и слабее — на цель. Обучение с подкреплением (RL) устойчивее, потому что функция ценности добавляет сведения о полезности действий, но эффект зависит от целевой функции и класса политики.

Якобиан показывает, какую часть входа использует политика

Чтобы отделить слабое обучение от сложности длинной задачи, авторы подключили на проверке идеальный планировщик. Он разбивал неизменную задачу на оптимальные подцели фиксированной дальности. Политика всегда получала близкую подцель, а менялся только горизонт целей, которые она видела во время обучения.

Даже в таком режиме политики клонирования поведения теряли качество по мере увеличения учебного горизонта. Значит, ошибка возникала не только из-за необходимости выполнить длинную последовательность: сама политика хуже реагировала на простые цели.

Реакцию измеряли якобианом входа — производной выбранного действия по текущему состоянию или цели. Большой якобиан цели означает, что небольшое изменение цели заметно меняет действие. При длинном учебном горизонте чувствительность систематически смещалась от цели к состоянию как у клонирования поведения, так и у разных вариантов RL.

Якобиан показывает только локальную реакцию нейросети и не измеряет взаимную информацию напрямую. Однако искусственное добавление несвязанных целей вызывало тот же сдвиг, что поддерживает предложенное объяснение.

Для исправления авторы обучили короткогоризонтную политику-учителя, а затем заставили длинногоризонтного ученика повторять не только её действия, но и якобиан по состоянию. Такое соболевское дообучение не копирует готовый план: оно переносит структуру чувствительности. Хотя штраф накладывали на зависимость от состояния, ученик начинал сильнее реагировать и на цель.

Метод проверили в 16 средах с перемещением и манипуляциями. Особенно заметен эффект там, где мешают посторонние объекты: в задаче cube-quadruple успех базового варианта составлял 2, а после переноса якобиана — 35.

Горизонт переобозначения целей нужно настраивать отдельно

Работа меняет не выбор между клонированием поведения и RL, а схему подготовки примеров. Если брать все будущие состояния как цели без контроля распределения, модель может получить широкий набор задач, но научиться игнорировать целевой вход. Геометрическое распределение в экспериментах иногда сохраняло качество даже при наличии далёких целей, поэтому сокращать горизонт до одного значения тоже не требуется.

Практическая проверка должна разделять учебный и проверочный горизонты. Политику стоит обучать на нескольких распределениях целей, а затем давать одинаковые близкие подцели и сравнивать успех. Если качество падает только из-за роста учебного горизонта, увеличение модели или длины планирования не устраняет источник проблемы.

  • Считать горизонт переобозначения целей настраиваемым параметром набора данных.
  • Оставлять отдельную проверку на близких целях, даже если продукт решает длинные задачи.
  • Сравнивать чувствительность к состоянию и цели, чтобы находить политики, которые формально принимают цель, но почти её не используют.
  • Рассматривать перенос якобианов прежде всего для задач с несколькими допустимыми порядками действий и отвлекающими объектами.

Эксперименты охватывают офлайн-обучение на данных взаимодействия, где цель совпадает с состоянием среды, а идеальный планировщик используется только для контролируемой проверки. Поэтому результаты хорошо изолируют причину деградации, но не измеряют выигрыш полного производственного контура с реальным планировщиком. Сам перенос якобианов также требует заметно больше вычислений, чем обычное обучение.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу