Журнал · Rit.work

SAGE не даёт LLM-агенту закреплять случайно удачные правки

SAGE сравнивает старый и новый навык агента на одинаковых заданиях и принимает правку, только если выигрыш надёжен, а уже освоенное поведение не ломается.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Новый фильтр для самообновляющихся LLM-агентов научился отклонять правки, которые повышают среднюю оценку, но ломают уже решённые задачи. В работе, которую пока не рецензировали и где все числа получили сами авторы, SAGE снизил частоту регрессий в 19 из 20 сочетаний модели и задачи. Командам, которые разрешают агенту автоматически переписывать свои инструкции, стоит пересмотреть правило «оценка выросла — принимаем».

Средняя оценка скрывает сломанные навыки

Самообновляющийся агент хранит постоянный документ навыка: в нём записаны порядок действий, правила вызова инструментов и логика решений. Оптимизатор предлагает правку этого документа, после чего фильтр решает, заменить ли текущую версию новой.

В SkillOpt и похожих системах фильтр обычно смотрит на общую оценку по проверочному набору. Если кандидат набрал больше, правку сохраняют. Такое правило не различает два сценария: агент мог освоить новые задания без потерь или исправить одни случаи ценой поломки других.

SAGE запускает текущий и изменённый навык на одних и тех же заданиях. Для каждого задания он записывает выигрыш, регрессию или ничью. Выигрыш означает, что кандидат решил задачу, которую прежний навык не решал; регрессия — что кандидат сломал ранее правильный ответ.

Регрессия получает больший вес, чем новый успех. Фильтр также ограничивает допустимую долю уже решённых заданий, которые может сломать кандидат. Поэтому небольшой рост средней оценки сам по себе больше не служит достаточным основанием для записи правки.

Второй уровень защиты учитывает шум проверочного набора. SAGE применяет одностороннюю статистическую проверку к выигрышам и регрессиям и принимает правку, только если перевес трудно объяснить случайностью. При недостатке свидетельств фильтр ничего не меняет и сохраняет прежний навык.

Метод проверяли на пяти текстовых наборах: LiveMath, SpreadsheetBench, SearchQA, OfficeQA и ALFWorld. В качестве базовых моделей использовали DeepSeek-V4, GLM-5.2, MiniMax-M3 и Qwen3.6. Оптимизатор SkillOpt, число предложенных правок и расход токенов оставались одинаковыми, поэтому эксперимент изолировал именно решение о приёмке.

Осторожный фильтр улучшил итоговый навык

SAGE показал лучший итоговый результат во всех проверенных сочетаниях модели и задачи. Средний прирост относительно обычного фильтра составил 8,73 балла. На LiveMath итоговая оценка DeepSeek-V4 выросла с 34,15 до 48,78.

На той же задаче частота регрессий снизилась с 36,5% до 0%. На задачах, где обычный фильтр и так редко пропускал вредные правки, выигрыш оказался меньше. Значит, дополнительная проверка приносит больше всего пользы там, где ответы шумны, а новая инструкция легко меняет уже освоенное поведение.

Сравнение вариантов метода разделяет эффект двух частей. Один только учёт результатов по отдельным заданиям улучшал итоговый навык в каждом эксперименте. Статистическая проверка затем дополнительно улучшала каждый результат, отбрасывая кандидатов, чей перевес мог возникнуть из-за удачного проверочного набора.

Планы стоит менять тем, кто уже разрешает агенту учиться самому

Работа предлагает менять не генератор правок, а место, где система решает судьбу кандидата. Если агент хранит изменяемую инструкцию, библиотеку навыков или правила работы с инструментами, фильтр приёмки стоит проектировать как отдельный компонент. Ему нужны результаты старой и новой версии на одинаковых заданиях, журнал локальных выигрышей и потерь, а также право отказаться от обновления.

Это не требует заменять базовую LLM или оптимизатор. SAGE можно поставить поверх существующего контура обновления, если для каждого задания есть однозначная проверка правильности. Практический сдвиг состоит в другом: проверочный набор становится источником парных наблюдений, а не одной итоговой оценки.

Границы применения пока существенны. Метод рассчитан на проверку с двумя исходами — задача либо решена, либо нет. Для оценок качества по шкале потребуется другой статистический критерий. Эксперименты охватывают текстовые задачи и фиксированный оптимизатор SkillOpt, поэтому результаты не показывают, как фильтр поведёт себя с изображениями или при совместном изменении генератора правок.

Статистическая гарантия относится к одной паре текущего и нового навыка. Проверочный набор повторно используют на протяжении всего обучения, поэтому метод не контролирует общую вероятность ошибочных обновлений по всей цепочке. Порог уверенности, цену регрессии и допустимую долю потерь также настраивают на отдельном наборе данных.

Для систем, где каждую правку проверяет человек, SAGE не меняет архитектуру принципиально. Для автономного контура он задаёт более безопасное правило: новое состояние становится постоянным не после любого роста средней оценки, а только после устойчивого перевеса без недопустимого ущерба уже освоенным действиям.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу