Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo и Jun Wang описали общую модель координации и обновления памяти в многоагентных LLM-системах в препринте, не проходившем рецензирования. В контролируемом запуске на SWE-bench система с проверяемой памятью решила 72,2% задач против 58,4% у многоагентного варианта с безусловной текстовой рефлексией. Работа важна командам, которые строят агентов для программирования, управления процессами и других задач, где результат можно проверить исполнением.
Что сделали
Авторы рассматривают распространённую архитектуру: оркестратор делит исходную задачу на части, рабочие агенты решают их, а результаты объединяются. Адаптация происходит не через изменение весов модели, а через внешнюю текстовую память, куда система записывает стратегии, замечания и выводы из предыдущих попыток.
Координация представлена как двухуровневая игра. На верхнем уровне оркестратор выбирает декомпозицию, на нижнем рабочие агенты улучшают локальные решения. Если зависимости между подзадачами ограничены, локальные изменения приближают систему к устойчивому состоянию. Чем больше общих переменных, интерфейсов и совместных ограничений оставляет декомпозиция, тем слабее эта гарантия.
Отдельная часть модели описывает рефлексию как переход между состояниями памяти. Без проверки система сохраняет как полезные, так и ошибочные выводы. Авторы показывают, что такая память может улучшаться лишь до некоторого уровня, если вредные записи продолжают поступать. Однако само безусловное сохранение ещё не доказывает наличие ненулевого предела ошибки: для этого требуется отдельное предположение о постоянном вреде.
Ключевой теоретический результат касается текстовой самопроверки. Авторы строят пару сред, в которых генерируется один и тот же текст, но одинаковая рекомендация полезна в одной среде и вредна в другой. Модель-оценщик, видящая только стенограмму, не может различить эти случаи независимо от своей способности анализировать текст. Различение становится возможным, если проверка получает сигнал от среды: результат тестов, состояние симулятора, ответ API или заключение формального проверяющего средства.
На этой основе предложен алгоритм Stochastic Reflective Memory Ascent, SRMA. Он создаёт кандидат на изменение памяти, выполняет фиксированную внешнюю проверку и сохраняет изменение только при строгом снижении проверяемого риска. Для вероятностных измерений авторы добавляют проверку уверенности, а для меняющейся среды — повторную привязку оценки к текущему состоянию.
Что показали
Теоретические гарантии SRMA условны. Если проверяющее средство согласовано с полезностью задачи, а генератор с ненулевой вероятностью предлагает исправления, проверяемый риск монотонно снижается. Скорость снижения может быть геометрической или полиномиальной в зависимости от того, как вероятность полезного предложения связана с текущей ошибкой.
Эксперименты охватывают игру со скрытыми ограничениями ресурсов, Overcooked и исправление программ на SWE-bench. Во всех случаях оценка поступала из среды: от правил игры, точного поиска пути или тестового стенда репозитория, а не от другой LLM.
В Overcooked проверяемый фильтр принимал 6,2% предложений, которые затем оказывались вредными по независимой оценке, против 34,5% у текстового фильтра. Итоговый риск составил соответственно 0,14 и 0,28. Это поддерживает главный тезис работы: полезен не дополнительный раунд рассуждения сам по себе, а доступ фильтра к информации, которой нет в сгенерированном тексте.
В испытании SWE-bench авторы сохранили одинаковые модель и вычислительный бюджет для проверяемого и безусловного многоагентных вариантов. Поэтому приведённое в лиде различие лучше изолирует эффект фильтрации памяти, чем сопоставление с внешней строкой публичной таблицы результатов.
Ограничения
Доказательства опираются на ограниченную связанность подзадач, конечные множества действий, согласованность проверяющего средства с реальной целью и наличие полезных кандидатов на обновление. В открытых рабочих процессах эти условия могут не выполняться. Если тесты неполны, алгоритм гарантирует улучшение только по результату этих тестов, а не по фактическому качеству продукта.
Механизмы проверяли в Resource Contest и Overcooked на пяти запусках, а программный эксперимент — на 500 задачах SWE-bench. Параметры скорости улучшения оценивались на наблюдавшихся траекториях и не обосновывают поведение на других состояниях. Для Kimi авторы не провели контролируемое сравнение с одиночным агентом: соответствующая строка взята из публичной таблицы, поэтому она отличается не только способом координации. Работа также отмечает расход дополнительных токенов, но не даёт сравнения стоимости систем.
Что это значит
Работа не даёт оснований заменять одиночную LLM группой агентов во всех продуктах. Её практический вывод уже: если система накапливает память между попытками, критерий принятия новых записей должен зависеть от результата в целевой среде. Текстовая критика может помогать формулировать кандидатов, но не заменяет тестовый стенд, симулятор, исполнение запроса или формальную проверку.
Для команд, которые строят агентов поверх проверяемых операций, планы стоит скорректировать на уровне архитектуры. Проверяющее средство становится отдельным компонентом контура памяти: оно должно работать по фиксированному протоколу, сравнивать текущее и предложенное состояния и отклонять ухудшения. Декомпозицию также следует оценивать не только по размеру подзадач, но и по числу зависимостей между ними.
Если итог нельзя отделить от текста агента внешним сигналом, SRMA не решает основную проблему. В таком продукте усиление текстового оценщика может улучшить средний результат, но теория работы не даёт гарантии против систематической ошибки. Поэтому главный критерий применимости подхода — наличие проверяемой обратной связи, а не выбор конкретной LLM.
Источники
Иллюстрация: рисунок из статьи «Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems», Yihang Chen, Yuxiang Chen, Yuxuan Huang и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



