Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из Arizona State University, Cisco Research и University of North Carolina at Chapel Hill разработали MASkills — способ непрерывно улучшать многоагентную LLM-систему через библиотеки процедур; работа опубликована как препринт, не проходивший рецензирования. На HotpotQA система получила F1 76,3 против 69,2 у лучшего приведённого конкурента. Подход важен командам, которые строят агентов с разделением ролей и хотят переносить накопленный опыт между задачами без дообучения моделей.
Что сделали
Обычная память агента хранит свободные текстовые записи о предыдущих действиях: что произошло, почему ответ оказался неудачным и что стоило сделать иначе. Авторы считают такую форму опыта неудобной для постоянного улучшения. Записи сложно вызывать в подходящий момент, они дублируются, устаревают и не задают готовую процедуру действий.
В MASkills единицей накопленного опыта становится навык — структурированный набор файлов. В нём есть краткое описание для поиска, подробная инструкция и при необходимости вспомогательные ресурсы: сценарии, конфигурация или справочные материалы. Агент сначала видит только компактные описания доступных навыков, а полное содержимое загружает в контекст после выбора. Это ограничивает расход контекста и отделяет поиск процедуры от её исполнения.
Во время выполнения задачи система записывает, какой агент и в какой момент вызвал конкретный навык. Затем централизованная модель-оценщик анализирует траекторию и распределяет вклад общего результата между вызванными навыками. Для каждого вызова она формулирует, помогла ли процедура команде, оказалась ли лишней или привела к ошибке. Оценка строится как сравнение с предполагаемым сценарием, в котором навык не использовался.
Отзывы объединяются между запусками, навыками и агентами. Инерционное сглаживание сохраняет повторяющиеся рекомендации и ослабляет влияние противоречивых замечаний из отдельных запусков. Это не градиентное обучение в математическом смысле: параметры LLM не меняются, а модель редактирует текстовые и файловые артефакты.
Библиотека развивается через уточнение существующих инструкций, создание процедур для повторяющихся неудач, объединение похожих навыков и удаление бесполезных. Предлагаемое изменение сначала проверяется на отложенных заданиях. Если результат ухудшается сильнее допустимого порога, система возвращает предыдущую версию библиотеки.
Что показали
Авторы проверили MASkills на HotpotQA для поиска ответа по нескольким источникам, LoCoMo для работы с долгой историей разговоров и GAIA для задач помощника с рассуждением и инструментами. F1 объединяет точность и полноту ответа в одну оценку, а результаты GAIA отражают долю успешно решённых заданий разных уровней.
На GAIA средний результат MASkills составил 23,3 против 20,4 у R1-Searcher, ближайшего конкурента в приведённой таблице. Перенос библиотек между задачами без дополнительной оптимизации также улучшал результаты относительно использованных авторами исходных вариантов, хотя конкретный эффект зависел от пары источника и целевой задачи.
Разбор компонентов показывает, что особенно важна проверка изменений с откатом. На многошаговой части LoCoMo её удаление снизило результат с 17,2 до 6,6. По интерпретации авторов, свободное редактирование процедур без контрольного набора может быстро закреплять неудачные изменения.
Ограничения
Эксперименты охватывают три исследовательских набора задач, а не длительную эксплуатацию продукта. Авторы работали преимущественно с кооперативными системами, где роли агентов и схемы коммуникации относительно стабильны. Работа не показывает, как библиотека ведёт себя при постоянной смене состава команды, в состязательной среде или после длительного накопления навыков.
Сами авторы отмечают риск роста библиотеки: поиск, объединение процедур и координация могут становиться сложнее по мере накопления артефактов. Проведённые сравнения не дают единой оценки при равном бюджете вызовов моделей, одинаковом объёме контекста и одинаковых вычислительных затратах. В работе также не приведены задержка и стоимость цикла, включающего дополнительные запуски, модель-оценщик, редактирование навыков и проверку на отложенных заданиях.
Наконец, библиотека наследует ошибки базовых LLM. Откат защищает от измеримого ухудшения на контрольных задачах, но не заменяет проверку безопасности, конфиденциальности и допустимости действий с внешними инструментами.
Что это значит
Работа не требует менять уже выбранную модель или оркестратор. Она предлагает другой слой накопления опыта: вместо общего журнала рефлексий — версионируемые процедуры с условиями вызова, журналом использования, оценкой вклада и контрольным откатом. Такой слой можно проектировать независимо от конкретной LLM.
Для новой системы разумно заранее отделить долговременные факты от процедур. Факты остаются в памяти или базе знаний, а повторяемые способы поиска, проверки и координации оформляются как навыки. Для существующего продукта вывод скромнее: переносить всю память в MASkills рано, но можно проверить подход на одном стабильном процессе, где есть воспроизводимый набор заданий и измеримая итоговая метрика.
Планы меняются прежде всего у команд, которые собирались бесконтрольно накапливать текстовые рефлексии. Работа показывает более управляемую архитектурную гипотезу, но пока не доказывает её экономическую эффективность в эксплуатации. До внедрения потребуется собственный замер качества, задержки, стоимости модельной оценки и частоты неудачных обновлений.
Источники
Иллюстрация: рисунок из статьи «MASkills: Continual Skills Optimization for Multi-Agent LLM Systems», Huaiyuan Yao, Xiaoou Liu, Charles Fleming и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



