Журнал · Rit.work

EASE подстраивает навыки ИИ-агента под модель-исполнитель

EASE ведёт профиль поведения модели и меняет хранилище навыков под конкретного исполнителя, снижая потери при переходе между LLM.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Куратор навыков ИИ-агента научили учитывать, как конкретная модель выполняет задания, и менять инструкции под её поведение. В работе New York University и New York University Shanghai EASE обошёл сильнейший базовый метод на 1,9–3,8 процентного пункта, хотя препринт не рецензирован и все числа получили сами авторы. Для систем со сменными моделями это предлагает альтернативу отдельному куратору под каждую LLM.

Один и тот же навык по-разному работает с разными исполнителями

Саморазвивающийся агент сохраняет удачный опыт как короткие процедурные инструкции. Перед новым заданием он извлекает подходящие инструкции из хранилища, а куратор после выполнения решает, какие навыки добавить, переписать или удалить. Параметры основной модели при этом не меняются.

Авторы показали, что такой куратор зависит от исполнителя — модели, которая читает навыки и действует в среде. Кураторы, обученные отдельно с Qwen3-8B, Qwen3-32B и GPT-OSS-120B, лучше всего работали именно со своей моделью. При перестановке исполнителей результат снижался на 2,3–10 процентных пунктов.

Причина не сводится к названию или размеру модели. Исполнители различаются тем, как проверяют допустимость действий, восстанавливаются после ошибок, отслеживают состояние среды и следуют извлечённым инструкциям. Навык с подробными проверками может помочь одной модели, но перегрузить контекст другой.

EASE поэтому не выбирает готовую стратегию по имени модели. Он составляет профиль по недавним траекториям: считает ошибки действий, попытки восстановления, лишние шаги и наблюдаемые признаки использования навыков. Скользящее окно позволяет профилю меняться вместе с исполнителем и хранилищем, а недоступный сигнал система не подменяет нулём.

Как куратор связывает правку с последующим результатом

Общий куратор получает профиль поведения, текущую траекторию, обратную связь среды и извлечённые навыки. После задания он выпускает последовательность операций над хранилищем. При развёртывании параметры и исполнителя, и куратора остаются фиксированными: меняются только профиль и набор навыков.

Куратора обучают с подкреплением сразу на нескольких замороженных исполнителях. В каждой серии связанные задания идут последовательно, поэтому инструкция из раннего задания может повлиять на более позднее. Так система учится не просто собирать общий опыт, а выбирать разные правки при разных наблюдаемых привычках модели.

Главная техническая деталь — отбор правок, которым можно приписать последующий результат. Первый фильтр пропускает изменение, только если затронутый навык позже попал бы в выдачу хранилища. Для удаления и замены система также проверяет восстановленную старую версию.

Второй фильтр сравнивает дальнейшие действия агента с сохранёнными траекториями без навыка. Если поведение заметно не изменилось, правка не получает сигнал обучения. Это не доказывает причинную связь, но убирает обновления по инструкциям, которые исполнитель, вероятно, не видел или не использовал.

Проверку провели в ALFWorld, ScienceWorld и WebShop. При обучении использовали семейства Qwen3 и GPT-OSS, а перенос проверяли на Kimi K2.6, DeepSeek V4 Flash и Gemini 3.5 Flash. Сравнение охватывает интерактивные среды с последовательными заданиями; оно не устанавливает, как метод поведёт себя в рабочих процессах с другими инструментами, сигналами обратной связи и правилами доступа.

Когда EASE меняет архитектурный план

На незнакомых исполнителях EASE занял первое место в восьми из девяти сочетаний модели и среды. Одновременно он хранил на 34,5–41% меньше навыков, а изменённые версии попадали в последующую выдачу на 36,3–38,7% чаще. Польза отдельной правки выросла на 51,8–60%, а расход токенов при работе снизился на 9,1–14,5%.

Для команды, которая планирует менять модели за единым API, вывод практический: хранилище навыков нельзя считать независимым слоем знаний. Вместе с траекториями стоит сохранять наблюдаемые характеристики исполнения и передавать их куратору. Профиль лучше строить по действиям, а не только по карточке модели: в разборе компонентов статические сведения вернули лишь часть потерянного качества.

Архитектуре также нужен раздельный контекст для каждого исполнителя. EASE не смешивает между потоками профили, хранилища и историю выполнения. Это усложняет состояние системы, зато не позволяет привычкам одной модели незаметно определять инструкции для другой.

Если продукт использует одного фиксированного исполнителя и вручную поддерживаемый набор процедур, работа не требует немедленной перестройки. EASE становится содержательным ориентиром там, где агент сам накапливает навыки, модель можно заменить без переобучения всей системы, а качество зависит от длинной последовательности заданий. В таком случае профиль поведения стоит заложить в схему журналирования до разработки автоматического куратора: восстановить нужные сигналы задним числом сложнее, чем собирать их вместе с траекториями.

Источники

Иллюстрация: рисунок из статьи «EASE: Behavior-Adaptive Skill Curation for Self-Evolving Agents», Zhen Xiong, Qiaoyu Tan, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу