Журнал · Rit.work

SearchAtlas показывает, где поисковый агент теряет доказательства

SearchAtlas превращает журналы поиска в графы доказательств и выявляет пропущенные условия, лишние ветви и ответы, которые опираются на непроверенные знания модели.

Rit.work
Студия разработки
11 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Поискового агента научились проверять не только по итоговому ответу, но и по тому, как найденные факты дошли до него. В работе Duke University и University of Pennsylvania автоматический разбор восстановил связи с F1 86%, хотя препринт не рецензирован, а числа получили сами авторы. Такой разбор добавляет к обычной проверке ответов аудит самого процесса поиска.

Как журнал поиска превращается в граф доказательств

Журнал агента обычно выглядит как длинная последовательность рассуждений, запросов, результатов и открытых страниц. Хронология не показывает, какой найденный факт породил следующий запрос, какие ветви оказались бесполезными и на чём держится финальный ответ.

SearchAtlas собирает из этого журнала ориентированный ациклический граф (DAG). Его узлы обозначают исходный вопрос, поисковые запросы с полученными материалами, непроверенные знания самой модели и итоговый ответ. Ребро показывает, что содержимое одного узла заметно повлияло на другой.

Система различает четыре типа связей. Условие исходного вопроса может перейти в запрос; найденный факт — в следующий запрос или ответ; неудачный поиск — вызвать новую попытку; информация без видимого источника — прийти из внутренних знаний модели.

Сначала обычная программа извлекает запросы, результаты, посещённые страницы и явные ошибки поиска. Затем LLM сопоставляет более поздние запросы с ранними доказательствами. Если несколько источников подтверждают один и тот же фрагмент, SearchAtlas оставляет минимальный набор связей, достаточный для объяснения перехода.

Финальный ответ разбивается на отдельные факты: имена, даты, числа и другие проверяемые фрагменты. Для каждого система ищет опору среди запросов. Если видимой опоры нет, факт связывается с узлом внутренних знаний модели — это делает непроверенный переход заметным при аудите.

Какие сбои становятся видны на графе

Граф оценивают по топологии пути к ответу, использованию условий вопроса и зависимости от непроверенных знаний. Эти признаки разделяют ошибки, которые выглядят одинаково при проверке только результата.

Для последовательных задач ожидается цепочка: агент сначала находит промежуточный объект, а затем использует его в следующем поиске. Для параллельных задач условия можно проверять независимо, поэтому доказательства должны вести к ответу более прямыми путями. SearchAtlas сначала определяет тип вопроса, а затем применяет подходящую схему оценки.

Использование условий проверяется не по всему журналу, а только на ветвях, которые дошли до ответа. Это отделяет реальную проверку требования от запроса, который агент выполнил, но затем отбросил. Отдельный показатель отмечает факты, которые модель добавила без подтверждения поиском.

Качество построения графов проверили на 100 траекториях с ручной разметкой. F1 здесь одновременно учитывает точность найденных связей и их полноту: высокий результат требует не добавлять лишние рёбра и не пропускать нужные.

Сводный диагностический балл ранжировал правильные и неправильные ответы с ROC-AUC от 0,840 до 0,856. Эта метрика показывает, насколько часто система ставит корректную траекторию выше ошибочной; случайное ранжирование соответствует 0,5, идеальное — 1.

Разбор расхождений показал, зачем процесс проверять отдельно от результата. Высокий балл иногда получала аккуратная цепочка, которая пришла не к тому объекту. Низкий балл мог сопровождать правильный ответ, если агент слишком долго искал или случайно угадал факт из внутренних знаний без проверки.

Когда SearchAtlas меняет планы разработки

Подход применим, если продукт использует многошаговый веб-поиск и сохраняет подробные траектории: запросы, результаты, посещённые страницы, сообщения об ошибках и финальный ответ. Тогда граф можно использовать для офлайн-аудита, сравнения версий агента и поиска повторяющихся сбоев, которые не отражает итоговая точность.

Для внедрения потребуется хранить происхождение доказательств как часть журнала выполнения. Если система записывает только запросы и ответы инструментов в сокращённом виде, SearchAtlas не восстановит скрытые зависимости: он видит лишь то, что агент явно оставил в траектории.

Метод проверяли на 1 350 англоязычных траекториях WebSailor, MiroThinker и конфигураций TYDP в трёх наборах задач с однозначными ответами. Вопросы сводились к последовательным или параллельным условиям; открытые исследования, другие языки и мультимодальные данные в эту проверку не входили.

Есть и архитектурная зависимость: ошибочное определение типа вопроса направляет траекторию к неподходящим показателям. Поэтому SearchAtlas разумнее добавлять поверх проверки итоговых ответов, а не использовать как единственный критерий качества агента.

Источники

Иллюстрация: рисунок из статьи «SearchAtlas: Analyzing Agentic Search Strategies via Evidential Query Graphs», Jiacheng Sang, Mengyuan Li, Sanxing Chen и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу