Журнал · Rit.work

SSPE чинит конфликтующие обновления навыка агента вместо отката

SSPE проверяет новые инструкции агента на старых задачах и переписывает их, если улучшение одной способности портит другую.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Текстовый навык агента можно обновлять под новые задачи, не стирая полезные процедуры из прежних. Метод SSPE не просто отклоняет конфликтующую правку, а пытается сохранить её пользу и устранить побочные эффекты, хотя препринт не рецензирован, а числа получили сами авторы. Для систем с регулярно меняющимися инструкциями это предлагает альтернативу полному переобучению и простому откату.

SSPE переносит идею из непрерывного обучения (continual learning). Там Orthogonal Gradient Descent убирает из шага обучения направления, которые меняют прежние прогнозы. У текстовой инструкции нет градиента и подходящего числового пространства, поэтому метод ищет конфликты по поведению агента.

Сначала модель свободно переписывает общий навык по свежим траекториям. Затем SSPE выбирает ранее освоенные способности, которых может коснуться правка, и запускает исходную и новую версии на одинаковых проверочных задачах. Если кандидат помогает текущей задаче, но портит старую, модель получает конкретные успешные и неудачные траектории и переписывает инструкцию; если совместимую версию найти не удалось, система сохраняет прежний навык.

При исполнении через GPT-5.4 итоговый навык набрал в среднем 77,5% на SpreadsheetBench, SearchQA, BFCL и DocVQA. После переноса той же инструкции без дополнительной адаптации на GPT-4.1 средняя точность составила 63,75% против 60,31% у агента без навыка. Преимущество не было одинаковым на всех задачах: другие варианты лидировали на SpreadsheetBench и SearchQA.

Проверка охватывала синтетические потоки и сгруппированную последовательность из четырёх предметных областей с преимущественно фиксированным порядком. SSPE сравнивали с неизменяемой инструкцией, SkillGrad, SkillOpt и агентом без навыка. Поэтому результат показывает, что поведенческая проверка помогает на таком потоке, но не устанавливает её устойчивость при произвольном чередовании задач.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу