Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Из нескольких параллельных прогонов поискового агента можно выбирать правильный ответ точнее, чем голосованием или дополнительной генерацией. В препринте Qisheng Zhou, Zhen Xiong и Qiaoyu Tan — работа не прошла рецензирование, а все числа получили сами авторы — селектор TRACE обрабатывал готовые траектории как минимум в 10 раз быстрее генеративных агрегаторов. Это позволяет отделить дорогой поиск от сравнительно дешёвого выбора ответа.
Как TRACE использует доказательства из соседних прогонов
Обычное голосование сравнивает только финальные ответы. Если большинство прогонов пришло к одной формулировке, система выбирает её, даже когда менее популярный ответ опирается на более подходящие источники.
TRACE рассматривает каждый прогон как последовательность поисковых запросов, найденных фрагментов и итогового ответа. Одинаковые фрагменты не сливаются: система сохраняет, по какому запросу и на каком месте агент получил каждый из них. Это важно, потому что один и тот же текст может подтверждать разные рассуждения в разном контексте.
Затем TRACE связывает прогоны. В WebQA связь возникает, если агенты нашли один и тот же фрагмент. При длительном поиске достаточно общего документа: разные прогоны могут открыть разные части одной страницы, поэтому точного совпадения текста не требуется.
Графовая нейросеть переносит информацию по этим связям. После этого каждый кандидат сверяет свой ответ только с запросами и доказательствами из собственной траектории, но эти данные уже содержат сигналы от других прогонов. Система возвращает один из существующих ответов и не запускает дополнительную LLM для составления нового.
Селектор обучают по меткам правильности готовых ответов. Модель векторных представлений и поисковые агенты при этом остаются неизменными. В оценку также входит частота одинаковых ответов, поэтому TRACE не отбрасывает сигнал голосования, а дополняет его сведениями о найденных источниках.
Выбор оказался точнее генеративного объединения
Основные тесты проводили при 16 параллельных прогонах. WebQA охватывал вопросы из NQ, HotpotQA, TriviaQA, PopQA, 2WikiMultiHopQA, MuSiQue и Bamboogle. Длительный поиск проверяли на BrowseComp-Plus, FRAMES и GAIA с разными агентами и моделями, которые создавали траектории.
На задачах длительного поиска TRACE достиг средней точности 78,6% и опередил голосование большинства на 3,1 процентного пункта. Один селектор применяли к разным наборам задач и двум генераторам траекторий без отдельной настройки под каждый агент.
В базовых WebQA-прогонах доля ответов, полностью совпавших с эталоном, составила 45,2% против 43,9% у сильнейшего генеративного агрегатора. Последний читал набор траекторий большой языковой моделью и формировал новый ответ, тогда как TRACE только ранжировал уже найденные варианты.
Разбор компонентов показал, что результат зависел именно от обмена доказательствами между прогонами. Когда связи между траекториями убирали, качество особенно заметно падало в длительном поиске. Сохранение отдельных вхождений также работало лучше, чем объединение одинаковых фрагментов или ответов в один узел.
Когда TRACE меняет архитектурный план
Работа предлагает пересмотреть этап после параллельного поиска. Если система уже часто находит правильный ответ хотя бы в одном прогоне, следующую вычислительную прибавку стоит искать не только в увеличении числа запусков, но и в выборе кандидата.
На базовых WebQA-траекториях TRACE с 8 прогонами уступил голосованию по 64 прогонам лишь 0,4 процентного пункта. Это не означает такого же сокращения расходов во всех продуктах, но показывает практический обмен: обученный селектор может заменить часть повторных запусков агента.
Для внедрения придётся сохранять больше данных, чем обычно нужно голосованию: поисковые запросы, найденные фрагменты, их порядок и идентификаторы документов. Если журнал содержит только финальные ответы, восстановить связи между доказательствами не получится. Понадобятся и размеченные примеры, чтобы обучить селектор для конкретного режима поиска.
TRACE подходит как отдельный слой между поисковым агентом и выдачей результата. Его можно обновлять независимо от агента и переносить между генераторами траекторий внутри одного поискового режима. Это снижает связанность компонентов: смена базовой LLM не обязательно требует заново проектировать этап объединения ответов.
Подход не заменяет генеративное объединение там, где итог нужно составить из частичных находок нескольких прогонов. TRACE всегда возвращает существующий ответ, поэтому правильный вариант должен уже находиться среди кандидатов. Для исследовательских отчётов и других задач синтеза генеративный этап может остаться необходимым; для вопросов с коротким проверяемым ответом работа даёт основание сначала испытать выбор по доказательствам.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



