Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из Rutgers University, University of Toronto, The Hong Kong Polytechnic University, Amazon и Microsoft представили SPACE для LLM-агентов, в препринте, который не проходил рецензирования. По замерам авторов, подход повысил долю успешно завершённых задач и сократил число раундов принятия решений LLM до 78,9% относительно лучших методов сравнения. Работа важна командам, у которых агент выполняет длинные последовательности типовых действий и тратит отдельное обращение к модели на каждый шаг.
Что сделали
Обычный агент с протоколом ReAct после каждого элементарного действия получает новое наблюдение, снова вызывает LLM и выбирает следующий шаг. Это позволяет часто корректировать план, но даже предсказуемая последовательность вроде перемещения к объекту и нескольких операций с ним требует серии обращений к модели.
SPACE вместо одного действия выдаёт серию переменной длины. Исполнитель последовательно применяет её к среде без дополнительных вызовов LLM, пока серия не закончится или среда не отклонит действие. Основная задача обучения здесь — определить границу: какие шаги безопасно выполнить вместе, а после какого нужно получить новое наблюдение.
Обычное обучение с подкреплением даёт агенту только итоговую награду за успех или провал эпизода. По наблюдениям авторов, такого сигнала недостаточно: стратегия либо возвращается к одному действию за раунд, либо формирует слишком длинные серии и продолжает выполнять устаревший план.
Чтобы разметить границы, авторы извлекали программные навыки из успешных траекторий. Навык верхнего уровня описывал последовательность поднавыков, а каждый поднавык соответствовал одной локальной серии действий. Сгенерированный код проверяли на синтаксис, возможность компиляции и согласованность сигнатур, после чего удаляли дубликаты.
Обучение объединяло траектории текущей стратегии и примеры, полученные через библиотеку навыков. Вклад отдельных серий в итоговую награду учитывался отдельно, чтобы успешный эпизод не давал одинаковый сигнал всем действиям. После обучения библиотека не нужна: агент получает историю взаимодействия и непосредственно генерирует элементарные действия, сгруппированные в серии.
Что показали
Авторы проверяли долю успешно завершённых задач и среднее количество раундов LLM на ALFWorld и ScienceWorld. Использовались как знакомые агенту варианты среды, так и отложенные варианты, которых не было при обучении.
На ALFWorld прирост доли успешных задач относительно наиболее результативного метода сравнения составил 7,0–15,6 процентного пункта. На ScienceWorld разница достигла 27,3–31,3 процентного пункта. В ALFWorld агенту SPACE требовалось в среднем 3,7–5,2 раунда LLM на эпизод.
По динамике обучения SPACE достигал итогового результата многошагового GRPO, использовав 26,6% его шагов обучения. Стратегия при этом формировала в среднем три-четыре элементарных действия за один раунд: промежуточный режим между пошаговым выполнением и длинными сериями без своевременного пересмотра плана.
Удаление программных навыков или отдельного распределения награды по сериям ухудшало и успешность, и количество раундов. Авторы интерпретируют это как признак того, что результат связан именно с обучением границ, а не только с разрешением выводить несколько команд за раз.
Ограничения
Проверка ограничена текстовыми симуляторами ALFWorld и ScienceWorld, моделями Qwen3-4B и Llama-3.1-8B-Instruct и подготовленными разбиениями на знакомые и незнакомые варианты задач. Работа не показывает, сохраняется ли эффект в браузере, операционной системе, корпоративном API или физической среде, где состояние меняется независимо от агента.
Для построения навыков нужны успешные траектории. Авторы не проверяли, насколько устойчиво обучение в домене, где такие примеры редки или требуют дорогого поиска. Статические проверки подтверждают корректность формы программного навыка, но не доказывают, что его выполнение семантически верно и безопасно.
Сравнение охватывает методы с подсказками, пошаговое обучение с подкреплением и многошаговый GRPO в тех же симуляторах. В работе нет сопоставления с рабочими агентными системами и нет перевода сокращения раундов в задержку, расход токенов или денежную стоимость. Поэтому число обращений к LLM здесь остаётся косвенной метрикой эксплуатационной эффективности.
Что это значит
Работа не даёт основания сразу менять рабочую архитектуру агента, но меняет план экспериментов. Если стоимость и задержка системы определяются повторными вызовами LLM для рутинных переходов, адаптивные серии действий стоит проверять отдельно от увеличения модели или усложнения подсказки.
Практический прототип потребует не только нового формата ответа модели. Исполнитель должен проверять каждое действие, останавливать серию при ошибке и сохранять наблюдения на уровне элементарных шагов. Для обучения понадобятся успешные журналы выполнения либо другой источник разметки границ. Оценивать следует одновременно долю выполненных задач, число вызовов LLM, расход токенов, задержку и частоту ошибок внутри серии.
Для детерминированных операций — навигации по меню, заполнения связанных полей, последовательных вызовов стабильного API — идея может уменьшить накладные расходы на принятие решений. В процессах с внешними изменениями, необратимыми операциями или требованиями безопасности преимущество менее очевидно: редкое получение наблюдений означает, что агент дольше действует по плану, который уже мог устареть.
Главный инженерный вывод состоит не в том, что агенту нужно всегда выдавать больше действий. Граница серии становится самостоятельной частью стратегии, которую необходимо обучать и проверять на данных конкретного процесса.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



