Журнал · Rit.work

Traverse учит поискового агента вовремя забывать и начинать заново

Traverse разбивает длинный веб-поиск на проверяемые этапы и позволяет агенту самому решать, когда сжать накопленный контекст и сменить направление.

Rit.work
Студия разработки
1 октября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Поискового агента научили самостоятельно замечать тупик, сохранять полезные сведения и продолжать работу с очищенным контекстом. Препринт Peking University и ByteDance, который не прошёл рецензирование и содержит замеры самих авторов, показывает результат 72,83 на BrowseComp. Для команд, строящих глубокий веб-поиск, работа предлагает заменить сжатие по лимиту токенов на управляемое действие самого агента.

Поиск заканчивается только после отдельной проверки

Traverse делит работу на три состояния: критерии, поиск ответа и проверку. Сначала агент превращает вопрос в список условий, которым должен соответствовать правильный ответ. Для задачи с несколькими подсказками это могут быть требования к фактам, диапазонам значений и формату результата.

Затем агент ищет сведения в интернете и сверяет находки с этим списком. Интерфейс показывает ему оставшийся запас токенов и ходов. Поэтому решение о продолжении зависит не только от содержания страниц, но и от того, сколько ресурсов осталось.

Найдя кандидата, агент переходит в состояние проверки. Там он заново изучает доказательства по каждому критерию и выбирает одно из двух действий: принять ответ либо вернуть его на доработку. Во втором случае поиск получает список невыполненных условий, замечания проверяющего и сведения о прежних неудачных кандидатах.

Проверка не служит финальным фильтром после завершённого поиска. Она входит в цикл и может изменить его направление. Агент продолжает работу не с исходного вопроса, а с конкретным указанием, какого доказательства не хватает.

Seal Memory отделяет полезные находки от истории поиска

При длинной работе контекст заполняют открытые страницы, неудачные запросы и гипотезы, которые уже пришлось отвергнуть. Обычное автоматическое сжатие ждёт заданного порога. К этому моменту агент может несколько раз пройти по одному тупиковому маршруту, а итоговое резюме закрепит этот маршрут.

В Traverse инструмент Seal Memory вызывает сам агент. Он решает, что поиск застрял или накопленный контекст стал слишком шумным, записывает структурированную сводку и начинает новый отрезок. В сводке остаются найденные доказательства, проверенные гипотезы, прошлые ошибки и дальнейший план.

После очистки активный контекст состоит из исходного вопроса и сохранённой сводки. Если понадобятся подробности, инструмент Read Memory возвращает их из памяти. Так система отделяет компактное рабочее состояние от полной истории взаимодействия, не заставляя модель постоянно перечитывать всё накопленное.

Этот механизм работает и во время поиска, и во время проверки. Агент может очистить контекст после неудачного исследования, а затем сделать это ещё раз, если проверка ответа разрослась в отдельное расследование.

Обучение последнего отрезка предотвращает отказ от памяти

Сжатие создаёт проблему для обучения с подкреплением. Один поиск распадается на несколько отрезков, но награда известна только после финального ответа. Если распространить её на всю цепочку, полезный ранний поиск могут наказать за позднюю ошибку, а случайные действия — наградить за последующее исправление.

При обучении всех отрезков результат на BC185 снизился с 60,4 до 51,7. Когда градиент применяли только к последнему отрезку, оценка выросла до 65,2. В неудачных вариантах агент со временем почти переставал вызывать Seal Memory либо начинал очищать контекст слишком рано и повторять одни и те же поисковые действия.

Управляемое агентом сжатие добавило 10,28 пункта относительно автоматического варианта. Первый вызов памяти происходил примерно втрое раньше по объёму накопленного контекста. Значит, преимущество даёт не более короткая история сама по себе, а способность связать очистку с моментом, когда направление поиска перестало приносить сведения.

Сначала Traverse обучали на отфильтрованных траекториях модели-учителя, исключая ошибочные вызовы инструментов. Затем обучение с подкреплением применяли только к состоянию поиска ответа и его финальному отрезку. Такой подход не учит напрямую каждое решение о сжатии, но штрафует ситуацию, когда агент исчерпал контекст и не сохранил промежуточный результат.

Архитектурный приём полезнее готовой модели

Работу проверяли на Traverse-35B, построенной на Qwen3.5-35B-A3B, с контекстом 256K и обучением на 96 GPU. В набор испытаний вошли BrowseComp, BrowseComp-ZH, xbench, DeepSearchQA, WideSearch, финансовые расследования и поиск товаров. Эти условия показывают перенос между несколькими видами веб-поиска, но выводы относятся прежде всего к точности и устойчивости длинных траекторий.

Командам не обязательно воспроизводить всё обучение, чтобы применить основную конструкцию. В план агента можно сразу заложить явный список критериев, отдельный этап проверки, хранилище полной истории и компактное рабочее состояние. Сжатие стоит оформить как доступное модели действие, а не только как аварийную процедуру при заполнении окна контекста.

Для обучения вывод уже: итоговую награду не стоит без разбора назначать каждому отрезку длинного процесса. Если система умеет очищать контекст, границы таких очисток меняют смысл обучающей выборки и вес отдельных траекторий. Traverse показывает один простой вариант — оптимизировать ближайший к результату отрезок, сохраняя ранние находки как данные, но не обучаясь непосредственно на них.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу