Журнал · Rit.work

Локальным навыкам LLM-агента нужна своя область памяти

Эксперимент с агентом для ремонта кода показывает: правка, проверенная на одном семействе задач, в общей памяти вредит другим, а поиск по области происхождения снимает конфликт.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Локально проверенные инструкции для LLM-агента могут ухудшать его работу на других типах задач, если агент достаёт их из общей постоянной памяти. В работе Yezhou Cheng и коллег, которая не прошла рецензирование и содержит их собственные замеры, память с ограниченной областью применения обошла общую и не допустила ни одной вредной принятой правки. Для архитектуры агента это разделяет два решения: стоит ли сохранить новый навык и в каких задачах его разрешено использовать.

Полезная правка становится вредной за пределами своей задачи

Агент решал задачи по ремонту кода и после каждого раунда мог переписать короткую текстовую инструкцию со своими навыками. Веса Qwen3-Coder-Next оставались замороженными: менялась только инструкция, которую агент получал при следующем запуске.

Шлюз ORC проверял предложенную правку на выполняемом коде. Он сравнивал старую и новую инструкции на закрытых тестах, проверял свойства программы после допустимых преобразований входа и отклонял изменение, если оно ухудшало уже встречавшиеся семейства задач.

Этой проверки оказалось недостаточно при общей памяти. Правило могло успешно пройти тесты текущего семейства, а затем попасть в запросы для задач с другим контрактом. Оно не было ошибочным само по себе: ошибочной становилась область его применения.

Это видно в эксперименте, где предложения, решения шлюза, программы и оценки оставили неизменными. При глобальном поиске средняя полезность траектории составила 0,713, а при выдаче навыка только исходному семейству — 0,816. Полезность траектории здесь означает средний результат всех последовательно развёрнутых версий агента на фиксированных скрытых проверках. Глобально вредными оказались 6 из 8 принятых правок; ограниченный поиск устранил такие случаи.

Как отделили качество отбора от области применения

Основной набор ProcStream-RSI представлял собой поток из 12 раундов. В нём повторялись семейства задач с разными контрактами: обработка границ, сортировка, нормализация, повороты и другие процедуры. Повторы позволяли проверить, сохранил ли агент прежние навыки после очередного изменения памяти.

На каждом раунде агент видел открытые примеры, исправлял программы и предлагал новую инструкцию. ORC допускал её только при улучшении на закрытых тестах текущего семейства и отсутствии обнаруженной регрессии на исторических семействах. Принятая инструкция либо заменяла общую политику, либо сохранялась в ячейке текущего семейства; во втором варианте остальные задачи продолжали получать исходную инструкцию.

Такой парный дизайн важнее сравнения двух независимо настроенных агентов. В первом вмешательстве менялся только поиск в памяти, поэтому разницу нельзя объяснить более удачным редактором, дополнительными вызовами модели или иным порогом шлюза.

Затем систему прогнали целиком на 27 потоках со случайным порядком семейств. Здесь варианты уже могли расходиться: содержимое памяти влияло на последующие ответы, предложения и решения шлюза. Проверяли не лучший сохранённый вариант агента, а всю реально развёрнутую последовательность.

Границы результата узкие. Эксперимент использовал одну замороженную модель, текстовые навыки и знакомые контракты ремонта кода. Маршрутизацию проверяли на шаблонных задачах с устойчивыми признаками семейства; работа не показывает, как тот же подход поведёт себя в открытом потоке, где класс задачи неясен или выбран неверно.

Командам стоит разделить сохранение навыка и его выдачу

В полном эксперименте ограниченная память повысила среднюю полезность траектории на 0,063 относительно общей. Она позволила принять 63 обновления против 12 и в большинстве потоков обновлялась неоднократно. Ни одна принятая локальная правка не ухудшила следующую скрытую проверку, тогда как при глобальном применении вредной оказалась половина обновлений.

Это меняет планы команд, которые дают агентам возможность постоянно редактировать подсказки, правила или навыки без обучения весов. Единого списка «лучших практик», автоматически добавляемого во все запросы, недостаточно даже при строгом шлюзе: проверка подтверждает правку только в пределах тех задач, на которых собраны доказательства.

Практическая схема состоит из трёх частей. Память хранит навык вместе с семейством, где он прошёл проверку. Маршрутизатор выбирает ячейку до сборки запроса. Если подходящей ячейки нет, агент использует исходную политику, а не ближайшую правку из общей памяти.

Шлюз при этом не становится лишним. Он отвечает на вопрос, помогает ли изменение внутри своей области, а маршрутизатор — где это доказательство действует. Работа показывает, что точный отбор правок не компенсирует слишком широкую выдачу: локально корректное правило всё равно может вмешаться в чужой контракт.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу