Журнал · Rit.work

SkillGLoW собирает навыки агентов по процедурам, а не по задачам

Авторы SkillGLoW предлагают хранить опыт LLM-агента как библиотеку общих процедур, а детали конкретной задачи восстанавливать во время выполнения.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Ao Yan, Xin Zhang, Jiawei Du и Joey Tianyi Zhou представили SkillGLoW — систему накопления текстовых навыков LLM-агента; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, сохранённые системой навыки повысили среднюю долю полностью решённых задач на 17,2 процентного пункта относительно агента без навыков. Результат важен командам, которые строят агентов для длинных потоков неоднородных задач и рассчитывают улучшать их без дообучения базовой модели.

Что сделали

Авторы рассматривают навык как текстовую инструкцию, добавляемую в контекст замороженной LLM. Проблема возникает при выборе единицы хранения. Один общий документ со временем превращается в набор слишком общих рекомендаций, а отдельная запись для каждой задачи раздувает библиотеку и сохраняет детали, которые плохо переносятся на новые случаи.

В SkillGLoW единицей повторного использования становится не задача, а семейство задач с общей процедурой решения. Например, разные задания могут требовать поиска маркеров в двоичном файле: конкретные форматы и значения меняются, но последовательность действий остаётся общей.

Система сначала несколько раз выполняет текущую задачу и получает оценку от проверяющего модуля — компонента, который определяет успешность результата. Из различий между попытками она формирует локальный навык: что сработало, что помешало и какие действия следует попробовать дальше. Эта запись относится только к текущей задаче и напрямую в долговременную библиотеку не попадает.

После обработки потока задач SkillGLoW группирует записи по сходству процедур. Для этого учитываются описание задания, траектория выполнения, текст локального навыка и краткая сигнатура решения. Каждое семейство сжимается в глобальный навык, содержащий условия применимости, основной порядок действий и типовые ошибки. Привязки к именам объектов, файлам или расположениям удаляются.

Кандидат на обновление проверяется реальным выполнением задач. Если новая версия библиотеки ухудшает результат относительно уже принятой, изменение отклоняется. Во время решения следующей задачи агент получает подходящий глобальный навык, а недостающие детали заново извлекает из обратной связи текущего запуска.

Что показали

Авторы проверили подход на математических задачах LiveMathematicianBench, автоматизации терминала Terminal-Bench-Pro, исправлении программ из SWE-bench Verified и управлении в среде ALFWorld. Во всех сочетаниях моделей и наборов задач глобальные навыки дали положительный прирост относительно режима без навыков.

Библиотека SkillGLoW оказалась в 3,6 раза компактнее плоского пула записей для отдельных задач. В сравнении со SkillOpt, который поддерживает один общий документ, SkillGLoW показал лучший результат в 15 из 21 сопоставимых измерений. Это поддерживает основную гипотезу работы: промежуточный уровень между общим документом и памятью отдельных случаев может быть полезнее обеих крайностей.

На ранее не встречавшихся заданиях ALFWorld средняя доля успеха выросла с 73,9% до 83,9%. Библиотеку при этом не изменяли, поэтому авторы интерпретируют результат как перенос процедуры, а не запоминание конкретных экземпляров.

Ограничения

Основные эксперименты охватывают 147 задач из четырёх исследовательских наборов и три базовые модели. Отдельная проверка переноса проведена на 60 заданиях ALFWorld, которые не встречались при построении библиотеки, но относятся к тем же категориям. Поэтому работа не показывает перенос на новую предметную область, где меняются и объекты, и типы процедур.

Авторы также не проверяли передачу библиотеки между разными моделями: навыки строились и применялись одной и той же замороженной LLM внутри каждого запуска. Нельзя заключить, что текстовая процедура, собранная одной моделью, сохранит пользу для другой.

Сравнение со SkillOpt показывает разницу с оптимизацией единого документа, а внутренние варианты эксперимента позволяют сопоставить SkillGLoW с плоским пулом и извлечением записей. Однако работа не устанавливает, как подход соотносится с другими архитектурами памяти в производственной эксплуатации. В приведённых результатах также нет оценки стоимости дополнительных запусков, задержки выполнения и расхода токенов на формирование локальных навыков, кластеризацию и проверку обновлений.

Что это значит

Работа меняет не выбор базовой модели, а проектирование памяти агента. Для системы, которая многократно решает однотипные задания, прежняя схема с единым документом может оставаться достаточной. Если же поток состоит из разных репозиториев, терминальных сценариев или задач управления, результаты SkillGLoW дают основание не хранить каждую успешную траекторию целиком.

Практический архитектурный вывод — разделить знания на два слоя. Долговременная библиотека содержит короткие процедуры для семейств задач, а конкретные параметры восстанавливаются во время текущего выполнения. Обновления следует принимать по результату запуска, а не по оценке качества текста моделью-оценщиком.

Для планов разработки это означает дополнительный контур инфраструктуры: проверяемые результаты выполнения, журнал траекторий, выделение процедурных семейств, сжатие навыков и безопасный откат библиотеки. Такой контур оправдан, если агент регулярно возвращается к родственным процедурам и стоимость повторных запусков приемлема. Начинать с автоматической самоизменяемой библиотеки пока рано: сначала стоит проверить на собственном потоке, существуют ли устойчивые семейства задач и переносится ли их процедура за пределы исходных примеров.

Источники

Иллюстрация: рисунок из статьи «SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams», Ao Yan, Xin Zhang, Jiawei Du и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу