Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
При обучении поискового LLM-агента сначала нужно улучшать поиск документов, а затем учить модель рассуждать по найденному: обратный порядок работает хуже. BRIDGE обошёл сильнейший базовый метод на задачах, где ответ приходится собирать из нескольких источников, причём больше выиграла меньшая модель. Для команд, которые обучают собственный RAG-агент, это меняет схему обучения, хотя препринт не рецензирован и все числа получили сами авторы.
Почему награда достаётся не тому компоненту
Поисковый агент чередует рассуждение, запросы к внешнему хранилищу и чтение найденных фрагментов. В типичной схеме обучения с подкреплением градиент проходит только через токены, которые сгенерировала LLM: рассуждение, поисковый запрос и итоговый ответ. Документы считаются наблюдениями среды и в функцию потерь не входят.
Из-за этого система неверно распределяет ответственность за ошибку. Если модуль поиска не нашёл нужный документ или поднял выше вводящий в заблуждение фрагмент, итоговая награда всё равно штрафует действия языковой модели. LLM учится иначе формулировать запрос или рассуждать вокруг неполных данных, хотя исправлять нужно поиск.
Проблема особенно заметна в вопросах, где факты разнесены по нескольким документам. Модель не может освоить правильную цепочку рассуждений, пока поиск не покажет все необходимые звенья. Поэтому простое совместное обучение двух компонентов ещё не решает задачу: важно, какой компонент обновляется первым.
Quan Xiao и соавторы проверили порядок на основе VT-Search. Схема «сначала настроить поиск, затем LLM» улучшала результат на большинстве наборов задач. Обратная схема давала меньший выигрыш, а на части общих вопросов уступала исходной модели, обученной только с подкреплением.
Работу проверяли на семи наборах открытых вопросов и пяти медицинских наборах с Qwen2.5-3B-base и Qwen2.5-7B-base. Для открытых вопросов считали точное совпадение ответа (EM), а в медицинских задачах — правильность ответа и качество рассуждения по оценке GPT-5.6 Luna. Среди сравнений были методы с фиксированным поиском, отдельной настройкой поиска и совместным обучением поиска и LLM.
Как BRIDGE сохраняет порядок во время совместного обучения
BRIDGE описывает обучение как двухуровневую задачу. На нижнем уровне модуль поиска подстраивается под текущую LLM и поднимает документы, которые помогают получить эталонный ответ. На верхнем уровне LLM учится с подкреплением на траекториях, созданных уже обновлённым поиском.
Поиск получает два сигнала. Итоговая бинарная награда показывает, закончилась ли вся траектория правильным ответом. Дополнительная функция потерь повышает позиции документов, с которыми текущая LLM вероятнее выдаёт эталонный ответ. Вместе они связывают результат не только с текстом модели, но и с фрагментами, которые она увидела.
Обновляется адаптер LoRA со стороны кодировщика запроса, тогда как кодировщик документов остаётся фиксированным. После шага поиска BRIDGE обновляет политику LLM по итоговой награде. Компоненты продолжают подстраиваться друг под друга, но поиск сохраняет приоритет внутри цикла.
На вопросах с несколькими переходами BRIDGE превысил результат сильнейшего базового метода на 9,6 пункта EM с Qwen2.5-3B-base и на 3,4 пункта с Qwen2.5-7B-base. На медицинских наборах он получил лучшую среднюю правильность ответов и качество рассуждений. В разборе компонентов двухуровневая схема также обошла как последовательную настройку, так и варианты, где поиск и LLM обновлялись независимо.
Меняет ли работа планы поисковых агентов
Если агент работает с собственным корпусом и его можно обучать по проверяемому ответу, фиксированный модуль поиска больше не выглядит безопасным выбором по умолчанию. Команде стоит отдельно измерять, находит ли поиск доказательства для ответа, а не пытаться компенсировать плохую выдачу дополнительным обучением LLM.
Плоское совместное обучение тоже стоит пересмотреть. BRIDGE показывает, что одинаковая награда для двух компонентов не учитывает причинную последовательность: сначала документы попадают в контекст, затем модель строит ответ. Практическая схема должна сохранять этот порядок хотя бы внутри каждого цикла обновления.
Полный двухуровневый расчёт обычно требует хранить два состояния модуля поиска и вычислять дорогие производные. BRIDGE использует приближение первого порядка и одно состояние. По сравнению с двухсостояниевой оценкой пиковая память на обновление поиска снизилась на 49,7%, а время такого обновления — на 55,8%. Это сравнение относится именно к способам решить двухуровневую задачу, а не к стоимости обычного обучения LLM.
Вывод пока относится к агентам для ответов на вопросы, плотному поиску документов и награде, которую можно автоматически проверить. Для агентов, вызывающих API, пишущих код или выполняющих процессы без однозначного эталонного ответа, тот же порядок потребует отдельной проверки. Но для RAG-систем с обучаемым поиском работа даёт конкретное изменение плана: сначала исправлять доступные модели сведения, затем её поведение на этих сведениях.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



