Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM-агента научили исправлять собственный план до вызова инструмента, если следующий шаг закрепляет ошибочную гипотезу. В препринте Renmin University of China, который не рецензирован и где все числа получили сами авторы, EditAct повысил итоговые оценки агентов на 3,2–6,7 балла относительно сильнейшего базового метода. Для длинных задач это предлагает альтернативу моделям, которые пытаются предсказывать ответы поиска, терминала или среды разработки.
Почему ответы инструментов заменили правкой состояния
Обычная языковая модель мира получает историю работы агента и предсказывает, что вернёт инструмент после следующего действия. Такой подход полезен для планирования без доступа к среде, но плохо подходит для изменчивых систем: результаты поиска зависят от индекса и ранжирования, а вывод терминала — от файлов, зависимостей и состояния процесса.
Если агент всё равно может вызвать настоящий инструмент, симуляция создаёт ещё один источник неподтверждённых данных. AEWM вместо ответа среды предсказывает, приблизит ли предложенный шаг решение задачи.
Авторы называют основную проблему загрязнением состояния задачи. Агент принимает предположение за факт, сохраняет устаревший план после противоречащего ему результата или считает промежуточный успех завершением работы. Ошибка остаётся в истории, поэтому следующие действия могут выглядеть логичными, хотя вся цепочка уже движется в неверном направлении.
AEWM получает историю, предложенное рассуждение и следующее действие. Компонент Action Judge относит решение к одному из трёх типов: критическое закрывает необходимый этап, исследовательское проверяет правдоподобную ветку, а шумное повторяет уже сделанное, нарушает условие или развивает неподтверждённую гипотезу.
Исследовательские действия сохраняются намеренно. Без отдельного класса проверка неизвестной ветки могла бы выглядеть как лишний шаг, хотя именно она снижает неопределённость и предотвращает преждевременный ответ.
Как EditAct заменяет ошибочный шаг
Если Action Judge принимает решение, агент выполняет действие в реальной среде и добавляет фактический результат в историю. Если решение признано шумным, State Revision генерирует новую пару из рассуждения и действия на основе той же доступной истории. В журнал попадает исправленная версия, а не критика рядом с исходной ошибкой.
Это отличает EditAct от подсказки «подумать ещё раз». Комментарий оставляет агенту выбор и не удаляет неверную предпосылку. AEWM непосредственно заменяет продолжение, которое повлияет на последующие шаги, после чего новый план проверяет настоящий инструмент.
Модель обучали в два этапа: промежуточное обучение охватило 52 млрд токенов, затем использовали 120 тыс. отобранных примеров для оценки и исправления действий. Разметку строили по завершённым траекториям: оценщик видел, помог ли конкретный шаг дальнейшему решению, но обучаемая модель получала только сведения, доступные до его выполнения.
Отдельная проверка Action Judge включала 3000 решений из поиска, терминальных задач и разработки ПО. Модель набрала 70,5% по макро-F1 — средней оценке качества по классам без поправки на их частоту — и опередила сильнейшую сравниваемую модель на 10,6 балла.
EditAct проверили на шести бенчмарках с тремя вариантами Qwen3.5. Он обошёл ReAct, выбор лучшего из нескольких действий и выбор лучшей полной траектории. Средний выигрыш составил 3,2–6,7 балла: меньшая модель получила больше пользы, чем старшая.
Что менять в планах агентной системы
Работа не предлагает универсальную замену инструментам или отдельный планировщик. Её практический тезис уже: если агент имеет доступ к настоящей среде, вычисления разумнее тратить на проверку его интерпретации и следующего действия, а не на воспроизведение ответа этой среды.
Такую схему проще всего применить там, где задача длится много шагов и ранняя ошибка остаётся в контексте: в глубоком поиске, работе с терминалом и изменении репозиториев. Для короткого одиночного вызова преимущество менее очевидно, поскольку EditAct добавляет оценку перед каждым незавершающим действием, а при шумном решении — ещё и его переписывание.
Интеграция требует, чтобы система могла выделить и заменить предложенную пару из рассуждения и действия до исполнения. Если агент доступен только как закрытый API с готовым вызовом инструмента, AEWM нельзя подключить как обычный внешний фильтр без изменения управляющего контура.
Есть и вариант без отдельной модели во время работы. Авторы собрали успешные траектории, в которых AEWM исправляла шаги, и дообучили на них агента методом отбора подтверждённых примеров. AEWM-RFT превзошёл самостоятельное дообучение на 2,2–2,6 балла без онлайн-подсказок AEWM. Для продукта это развилка между дополнительными вызовами модели при каждом задании и переносом исправленных шаблонов поведения в основной агент.
Пока результаты подтверждают архитектурный приём, а не готовую экономику внедрения. Команде всё равно придётся сопоставить прирост качества с задержкой, расходом токенов и доступностью редактируемого состояния в собственной системе.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



