Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Составной LLM-агент научили исправлять повторяющиеся ошибки, не меняя модель, программу и поиск. В препринте Wuhan University, который не рецензирован и где числа получили сами авторы, NLPG обошёл сильнейшие указанные методы сравнения в среднем на 8,71 процентного пункта. Такой подход добавляет агенту отдельный контур обучения поверх уже работающей системы.
Как ошибка находит виновный модуль
Агент редко отвечает одним вызовом модели. Программа сначала формирует запрос, затем получает документы, объединяет факты, проверяет доказательства и готовит итоговый ответ. Если ответ неверен, общая оценка не показывает, на каком шаге возникла ошибка.
NLPG записывает наблюдаемую цепочку выполнения: вход каждого модуля, его явный результат, связи с последующими шагами и финальный ответ. Скрытые рассуждения модели системе не нужны. После проверки результата отдельный критик проходит по графу модулей в обратном порядке и связывает итоговую ошибку с конкретным маршрутом.
Критик формулирует не новую версию всего запроса, а короткое исправление для ответственного шага. Например, правило может требовать сохранить сущность при построении поискового запроса, проверить достаточность доказательств или выбрать наиболее точную общую характеристику двух объектов.
В одном разобранном случае поиск уже нашёл нужные документы, но агент назвал двух людей «музыкантами» вместо более точного ответа «гитаристы». Локальное правило изменило второй поисковый запрос и вернуло точный ответ, хотя полнота найденных документов осталась прежней. Это единичный пример, но он показывает разницу между исправлением процедуры и добавлением новых данных.
Как исправление становится многократно используемым правилом
Одной неудачи недостаточно, чтобы менять поведение агента. NLPG группирует похожие исправления по модулю, типу ошибки и нормализованному тексту. Приоритет растёт, если правило подтверждают несколько независимых выполнений, ошибка сильнее повлияла на результат, а критик уверен, что исправление можно применять повторно.
После фильтрации система сохраняет правило во внешней памяти. При следующем запуске агент выбирает ограниченное число наиболее полезных инструкций для конкретного модуля и добавляет их к исходному контексту. Поэтому память не разрастается в один глобальный запрос, который влияет сразу на все части программы.
Новая версия памяти начинает действовать только в следующем раунде. Перед этим её проверяют на отдельной выборке: обновление принимают, если оно улучшает целевой результат и не создаёт недопустимых ухудшений. Модель, исходные подсказки, схема программы и поисковая система при этом остаются прежними.
NLPG превзошёл лучшие указанные методы сравнения на всех проверенных задачах: разрыв составил от 2,23 до 23,11 процентного пункта. На IFBench удаление текстовых исправлений ухудшило результат на 5,3 пункта, отказ от накопления правил или явного типа ошибки — на 4 пункта, а удаление привязки ошибки к маршруту — ещё на 3,3 пункта. Значит, прибавку даёт не только дополнительная инструкция, но и точный выбор места, где она действует.
Что придётся изменить в архитектуре агента
Работа не предлагает замену дообучению модели. NLPG исправляет процедурные привычки уже собранного агента: как формировать запрос, передавать доказательства между модулями, соблюдать формат и выбирать уровень точности. Если проблема лежит в знаниях модели или возможностях инструмента, память правил сама по себе её не устраняет.
Для внедрения понадобятся стабильные идентификаторы маршрутов, журнал явных промежуточных результатов, проверяемый итог и отдельное хранилище версий правил. Контур обновления лучше отделить от рабочего выполнения: сначала собрать и оценить цепочки, затем построить новую память, проверить её и только после этого включить.
Подход лучше всего соответствует повторяющимся процессам, где можно определить правильный результат или хотя бы проверить ограничения. Для непрозрачного агента с одним вызовом модели NLPG не сможет точно распределить ответственность: ему нужны модули и зафиксированные зависимости между ними.
Метод проверяли на LoCoMo, HaluMem, LongMemEval, HotpotQA, IFBench и HoVer. Эти наборы покрывают долговременную память, рассуждение по нескольким документам, выполнение инструкций и проверку доказательств; в переносе между задачами использовали Qwen3-8B и GPT-4.1 Mini. Внутри каждого сравнения совпадали модели, подсказки, поиск и оценивание, а примеры для построения правил, их выбора и финальной проверки не пересекались.
В статье нет расчёта эксплуатационной стоимости построения памяти, поэтому число дополнительных вызовов критика и задержку придётся измерить на собственных цепочках. При работе с пользовательскими данными журнал и выведенные из него правила также требуют минимизации данных, разграничения доступа и проверки перед публикацией новой версии.
Для продуктовой команды вывод практический: вместо регулярного переписывания общего запроса можно добавить управляемую память на уровне модулей. Но самоулучшение здесь означает контролируемый пакетный цикл с оценкой и откатом, а не самостоятельное изменение агента во время каждого пользовательского запроса.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



