Журнал · Rit.work

FlexLoop ускоряет циклические политики без потери полной глубины

FlexLoop переносит качество циклической RL-политики на промежуточные шаги и позволяет сокращать вычисления для простых состояний.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Циклическую политику глубокого обучения с подкреплением научили менять объём вычислений для каждого состояния, а не всегда выполнять весь цикл. Команда Tsinghua University показала сокращение средней глубины до 43% при сопоставимом качестве, хотя препринт не прошёл рецензирование и все числа в нём получены авторами. Для команд это способ снизить задержку уже обученной политики, но не разрешение просто включить ранний выход в существующей модели.

Почему ранний выход из цикла не работает сам по себе

Циклическая политика несколько раз применяет один блок с общими параметрами. Каждый проход увеличивает вычислительную глубину, но не добавляет параметров: модель уточняет внутреннее представление состояния и затем выбирает действие.

Такая архитектура кажется естественной основой для переменного бюджета. Простое состояние можно обработать за несколько проходов, сложное — на полной глубине. Работа показывает, что стандартное обучение не создаёт это свойство автоматически.

Если политику обучали принимать решение после последнего прохода, промежуточные выходы остаются внутренними вычислениями. Качественные действия концентрируются около полной обученной глубины, а более ранние решения резко уступают им. Авторы называют это специализацией по рекуррентной глубине.

Из этого следует практическое ограничение: уменьшить число проходов после обучения недостаточно. Даже сильная политика на полной глубине может выдавать почти бесполезные действия на предыдущих шагах. Поэтому порог ранней остановки нельзя безопасно подобрать только по итоговому качеству модели.

Как FlexLoop переносит качество на ранние шаги

FlexLoop начинает с предобученной политики фиксированной глубины и продолжает обучать её на исходной задаче. Целевая функция обучения с подкреплением действует на последнем шаге и удерживает качество полной модели.

Одновременно каждый промежуточный выход учится повторять решение следующего, более глубокого выхода. Перенос идёт по соседним шагам: последний обучает предпоследний, тот — предыдущий. Градиент через выход учителя не проходит, поэтому более мелкий шаг подстраивается под более глубокий, а не наоборот.

Сочетание двух целей оказалось существенным. Одно продолжение исходного обучения почти не улучшало ранние решения. Одна дистилляция ухудшала перенос на незнакомые задачи, а совместное обучение всех глубин по исходной функции могло снижать качество полного прохода. FlexLoop разделяет роли: исходная цель сохраняет способность решать задачу, дистилляция распространяет её на меньшую глубину.

После такого дообучения разница между соседними выходами становится сигналом остановки. Если распределения действий почти совпали, вычисление завершается; если политика продолжает заметно меняться, блок выполняется ещё раз. Один порог задаёт компромисс между расходом вычислений и качеством без нового обучения модели.

Метод проверяли на 30 средах с длинным горизонтом: BoxPick, LightsOut и задачах OGBench. В набор вошли онлайн- и офлайн-обучение, дискретные и непрерывные действия, а также проверка на незнакомых экземплярах задач. Основой служили политики IRU с пятью рекуррентными шагами и алгоритмами GC-DQN, GC-PPO и GC-IQL.

FlexLoop сохранял результат полного прохода и делал промежуточные решения пригодными для выполнения. Адаптивная остановка сокращала среднюю глубину до 43%, а в нагрузочном тесте дала ускорение до 1,34 раза. Последний замер проводили на BoxPick-Exact-4 с пакетом из 32 768 параллельных сред, поэтому это не универсальная оценка задержки для любого оборудования и размера пакета.

Меняет ли работа планы разработки

Если продукт уже строится на циклической RL-политике, ранний выход стоит считать отдельным этапом обучения, а не настройкой среды выполнения. В план нужны доступ к исходной функции обучения и данным или взаимодействию со средой, дообучение соседних глубин и отдельная настройка порога остановки.

Разница между сокращением глубины и ускорением по времени также важна для оценки инфраструктуры. Меньшее число проходов не превращается в такую же долю экономии задержки, поэтому итог нужно измерять на целевом оборудовании, с рабочим размером пакета и реальным окружением.

Работа сильнее всего влияет на системы, где сложность решений заметно меняется по ходу эпизода. В визуализациях политика тратила больше проходов около поворотов, целей и смены подзадачи, а на прямолинейных участках останавливалась раньше. Если почти все состояния требуют полной глубины, пространство для экономии будет меньше.

Метод не привязан только к IRU: в экспериментах он также улучшал ранние выходы политик на LSTM. Однако проверка охватывает целевые задачи с длинным горизонтом и несколько конкретных алгоритмов обучения с подкреплением. Для другой архитектуры вывод пока практический, а не гарантированный: промежуточные выходы следует обучать явно и сравнивать по качеству, средней глубине и фактическому времени выполнения.

Источники

Иллюстрация: рисунок из статьи «FlexLoop: Depth-Elastic Looped Policies for Adaptive Test-Time Computation in Deep RL», Xun Wang, Ruishuo Chen, Yu Chen и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу