Журнал · Rit.work

CHART учит поискового агента переживать смену обвязки

Amazon предложила менять системные инструкции по ходу обучения, чтобы агент сохранял параллельный поиск после обновления промпта и переноса в другую среду.

Rit.work
Студия разработки
22 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Поискового агента научили сохранять параллельный поиск после переписывания системной инструкции. Команда Amazon показала, что ротация инструкций переносит это поведение на незнакомые формулировки, тогда как статическая смесь почти не помогает, хотя препринт не рецензирован, а все числа получили сами авторы. Для разработки это означает, что рабочую обвязку стоит считать частью обучающей среды, а не сменным текстовым параметром.

Как ротация сохраняет обучающий сигнал

Обвязка агента задаёт системную инструкцию, описание инструментов, формат ответа и рекомендуемую стратегию работы. Задача при этом может не меняться: агент по-прежнему ищет ответ в интернете, но получает иначе сформулированные правила.

При обучении на одной обвязке Qwen3-30B-A3B связал параллельный поиск с её формой. После замены инструкции модель возвращалась к последовательной работе: отправляла запрос, ждала ответ и только потом формировала следующий. Способность запускать несколько запросов одновременно сохранялась, но проявлялась лишь при знакомых подсказках.

Простое добавление вариантов не решило проблему. В GRPO модель сравнивает несколько попыток ответить на один вопрос и учится на разнице в награде между удачными и неудачными траекториями. Награда зависела от правильности ответа и соблюдения формата; параллельные вызовы отдельно не поощряли.

Маленький статический набор быстро исчерпывает полезную разницу: модель осваивает его формулировки, после чего попытки становятся слишком похожими. Большой набор распределяет обучающие попытки между множеством вариантов, поэтому сигнал для каждой отдельной обвязки оказывается слабым.

CHART оставляет небольшое активное окно из общего пула в 33 обвязки. В основном варианте одновременно обучались 3 из них. Через каждые 20 шагов метод проверял поведение: обвязку с долей параллельных ходов не ниже 85% выпускали из окна, а её место занимал ещё не освоенный вариант с показателем около 60%. Так в обучении постоянно оставались инструкции, на которых модель уже способна улучшаться, но ещё не закрепила нужную стратегию.

Параллельный поиск перенёсся на новые инструкции

На отложенных обвязках CHART-3 запускал параллельный поиск в 89% ходов. Лучший статический набор достиг только 5%. Эти инструкции не просили работать параллельно, поэтому тест проверял, стало ли поведение правилом по умолчанию, а не реакцией на прямую команду.

Статическое обучение особенно зависело от подсказок. Даже его лучший вариант довёл параллельные ходы до 91% там, где инструкция явно направляла агента, но получил лишь 13% на вариантах без такой подсказки. Значит, разнообразие формулировок само по себе учит распознавать больше сигналов, но не обязательно отделяет стратегию от текста инструкции.

Перенос сохранился и при одновременной смене вопросов, поисковой среды и обвязок. На задаче товарного поиска доля правильных ответов с первой попытки оказалась на 5,6 процентного пункта выше, чем у лучшего статического набора. Рост параллелизма сверх определённого уровня уже не повышал точность, поэтому сам по себе максимум вызовов не служит целью.

Работу проверяли на одной модели, одном поведении и задачах с веб-поиском. Менялась системная инструкция, а интерфейс инструментов оставался прежним. Результат поэтому относится к устойчивости параллельного поиска к формулировкам, но пока не показывает, переживёт ли агент переименование функций, появление лишних инструментов или перенос метода на другие семейства моделей.

Что меняется в плане разработки агента

Если команда дообучает агента с подкреплением, фиксировать одну производственную системную инструкцию на весь цикл рискованно. После обучения даже редактура роли, формата или языка может отключить поведение, которое считалось закреплённым. Проверять нужно не только качество ответа, но и частоту нужного действия на разных обвязках, включая варианты без прямой подсказки.

CHART предлагает планировать обвязки как учебную программу. Сначала команда собирает разные инструкции, затем держит в работе небольшое окно и заменяет освоенные варианты теми, где агент уже показывает зачаток нужного поведения. Слишком лёгкие инструкции не дают нового сигнала, а слишком далёкие от текущих возможностей расходуют попытки без закрепления.

Ширину окна и порог выпуска нельзя переносить в продукт как готовые настройки. В эксперименте широкое окно работало хуже, потому что на каждую обвязку приходилось меньше попыток. Для другого бюджета, поведения и модели соотношение изменится, поэтому эти параметры придётся выбирать по промежуточным проверкам.

Работа не отменяет регрессионные тесты системных инструкций. Она меняет место, где команда борется с чувствительностью: не только подбирает удачный промпт после обучения, но и заранее учит модель выполнять стратегию при разных формулировках. Такой этап имеет смысл включать в план, если продукт регулярно меняет роли агента, язык, формат ответа или правила вызова поиска.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу