Журнал · Rit.work

Как обучать Deepresearch-агента на его собственных поисковых траекториях

DLD-RL превращает истории веб-поиска в данные для длинного контекста, а затем использует их, чтобы улучшить чтение источников и работу поискового агента.

Rit.work
Студия разработки
21 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Поискового агента Deepresearch научили лучше собирать ответ из множества веб-источников и не теряться в накопившемся контексте. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, новый цикл обучения в среднем обошёл обычное обучение агента с подкреплением на 7,3%. Для команд, которые дообучают таких агентов, журнал вызовов инструментов становится повторно используемым учебным набором без новой ручной разметки.

Как история поиска становится длинным учебным примером

Deepresearch-агент несколько раз ищет информацию, открывает страницы и накапливает найденные свидетельства. Чем дольше идёт работа, тем сложнее связать факты из разных документов и не принять прежнее предположение за подтверждённый вывод.

Сильная языковая модель разобрала 1000 неудачных траекторий — полных историй отдельных запусков. С недостаточным пониманием длинного контекста оказались связаны 61,6% ошибок: агент пропускал уже найденные факты, не соединял свидетельства из разных документов или писал утверждения без опоры на источники.

Обычное обучение с подкреплением плохо исправляет этот класс ошибок. Правильные ответы чаще приходят из коротких траекторий, где агент быстро нашёл нужную страницу. Длинные запуски чаще получают отрицательную награду, поэтому модель почти не видит положительных примеров устойчивой работы с большим объёмом накопленной информации.

Метод DR-to-Long повторно использует такие запуски. Инструмент Search возвращает адреса и короткие фрагменты страниц, а Visit — сжатое содержание выбранной страницы. При подготовке данных эти сокращённые наблюдения заменяют полными текстами по тем же адресам, сохраняя исходный вопрос, найденные документы и правильный ответ.

Успешную траекторию можно преобразовать напрямую: раз агент ответил правильно, нужные свидетельства уже были среди найденных страниц. Неудачную траекторию дополняют компактными свидетельствами из успешного запуска по тому же вопросу. В ней остаются отвлекающие и конфликтующие документы, но контекст уже содержит достаточно данных для ответа.

В основных экспериментах так собирали примеры длиной от 64 до 128 тысяч токенов. Новая разметка не нужна: вопрос, эталонный ответ, адреса страниц и результат запуска уже появились на предыдущем этапе обучения агента.

Почему обучение возвращается к поиску после чтения документов

DLD-RL строит последовательность из трёх учебных задач. Сначала модель недолго обучают искать и открывать страницы, чтобы собрать траектории. Затем из этих траекторий делают задания LongQA: модель получает длинный набор документов без поисковых инструментов и должна сразу вывести ответ.

На этапе LongQA модель учится находить свидетельства, связывать документы и отбрасывать похожие, но бесполезные страницы. Её одновременно штрафуют за слишком сильное отклонение от замороженной версии после первого этапа. Это помогает сохранить навыки вызова инструментов, пока модель осваивает другую задачу.

После LongQA обучение снова переключают на Deepresearch. Этот последний этап нужен, чтобы улучшенное чтение длинного контекста превратилось в более точные поисковые решения, а не осталось отдельным навыком ответа по заранее выданным документам.

На трёх испытаниях длинного контекста средний относительный результат вырос на 13,5%. Изменилось и поведение агента: у более крупной модели среднее число вызовов Visit поднялось с 11,26 до 21,34 на задачу. Модель стала чаще читать полные страницы вместо повторных поисков по близким запросам.

Когда работа меняет план разработки агента

Подход касается команд, которые управляют дообучением модели и сохраняют полные истории запусков. Для DLD-RL нужны запросы к поиску, адреса посещённых страниц, наблюдения инструментов, финальный ответ и сигнал о его правильности. Одних итоговых ответов в журнале недостаточно: по ним нельзя восстановить многодокументный контекст.

Неудачные запуски при этом не стоит сразу удалять. В работе они дают более сложные учебные примеры, потому что содержат лишние документы и неудачные ветви поиска. Чтобы такой пример оставался решаемым, его нужно связать с успешной траекторией того же вопроса и добавить недостающие свидетельства.

Проверка охватывает модели DR-Venus-4B и Qwen3.5-9B, а также BrowseComp-300, SEAL-0, XBench-2510, LongBench-v2, Frames и LongReason. Это показывает результат на двух масштабах модели и на задачах веб-поиска и длинного контекста, но вывод относится именно к агентам, которых можно последовательно дообучать на обеих задачах.

Практическое изменение плана состоит не в увеличении окна контекста само по себе. Команде нужно заложить сбор траекторий, восстановление полных текстов страниц и отдельный этап обучения по длинным документам, после которого модель снова возвращается к исходной агентской задаче. Такая схема превращает накопленные журналы поиска из отладочного следа в источник учебных данных.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу