Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Систему с генерацией, дополненной поиском по документам (retrieval-augmented generation, RAG), научили одновременно учитывать содержание фрагментов и структуру нескольких документов. На корпусе из 2,84 млн страниц RIT-RAG обошёл сильнейший базовый метод на 6,8–11,4 пункта точности. Команды могут сохранить обычный поисковый индекс и добавить навигацию поверх него, хотя препринт IBM и IIT Kharagpur не рецензирован и все числа получили сами авторы.
Поиск сначала находит районы, а модель выбирает нужный раздел
Обычный агентный RAG ищет отдельные фрагменты, передаёт их модели и при необходимости повторяет запрос. Такой агент видит текст, но не знает, что один фрагмент относится к главе с финансовыми результатами, а другой — к примечанию в отчёте другой компании. Похожие термины могут привести его к правдоподобному, но бесполезному материалу.
Структурные методы вроде PageIndex действуют наоборот. Они показывают модели оглавление, позволяют выбрать раздел и только затем загружают его содержимое. На большом корпусе полные деревья документов не помещаются в контекст, поэтому система сначала выбирает один документ. Если выбор оказался неверным, модель продолжает аккуратно искать не там.
RIT-RAG начинает с широкого поиска по всему корпусу. Каждый найденный фрагмент связан с узлом документа: разделом, подразделом или страницей сайта. Система оставляет наиболее подходящие узлы, добавляет путь от каждого из них к корню и собирает компактный набор деревьев. В него могут одновременно попасть разделы из нескольких документов.
Модель получает не весь найденный текст, а эту карту с названиями узлов, их краткими описаниями и ключевыми словами, если они доступны. Она выбирает перспективные разделы и отдельно запрашивает их содержимое. Если карта не ведёт к ответу, модель переформулирует поисковый запрос и получает другой набор деревьев.
Для такой схемы документы заранее разбивают по структурным узлам: фрагмент не должен пересекать границу раздела. Дерево строят из оглавления, заголовков или карты сайта, а в поисковый индекс добавляют идентификатор узла и цепочку его предков. Поэтому размер карты зависит от найденных кандидатов, а не от размера всего корпуса.
Структура повысила точность, но увеличила стоимость запроса
Метод проверяли на WixQA, FinanceBench и QASPER, а также на EntQABench с технической документацией крупной компании. В сравнение вошли обычный RAG, агентный поиск, графовые системы и PageIndex. Для EntQABench результаты проверили на нескольких LLM; на этом корпусе узлы содержали только названия, без сгенерированных описаний.
RIT-RAG показал самую высокую долю правильных ответов на всех публичных наборах. При одинаковом поисковом механизме он опередил агентный RAG на 2,4–10,5 пункта. Разбор прочитанных фрагментов показал причину: агентный поиск чаще захватывал нужные сведения вместе с лишними, PageIndex точнее выбирал материал, но мог пропустить правильный документ, а RIT-RAG лучше уравновешивал эти свойства.
За навигацию приходится платить дополнительным контекстом. При работе с Haiku запрос через RIT-RAG стоил в среднем 4,9–10,1 цента против 1,0–4,8 цента у агентного поиска. Модель при каждом поисковом цикле читает сериализованное дерево, включая описания и ключевые слова, поэтому рост точности не означает снижения расходов.
Поисковый индекс можно оставить, архитектуру агента — придётся изменить
Работа не требует заменять векторный или гибридный поиск. Практическое изменение находится между поисковиком и LLM: к каждому фрагменту нужно привязать положение в документе, а агенту дать раздельные инструменты для просмотра структуры и чтения содержимого. Это позволяет проверить подход без перестройки всего поискового слоя.
RIT-RAG стоит включить в план экспериментов, если система работает с длинными отчётами, документацией из множества страниц или вопросами, где ответ нужно собрать из нескольких документов. Именно здесь ранний выбор одного файла и потеря границ разделов создают ошибки, которые не исправляет простое увеличение числа найденных фрагментов.
Перед внедрением нужно проверить качество иерархии. Метод зависит от оглавлений, заголовков или карты сайта; слабая разметка и ошибки разбора ухудшают карту, которую видит агент. Для FinanceBench исследователям пришлось строить более подробные оглавления с помощью LLM, тогда как существующей структуры EntQABench хватило без такой обработки.
Текущая версия также накапливает прочитанные узлы до заполнения контекста, не удаляет старые свидетельства и игнорирует перекрёстные ссылки между соседними разделами. Поэтому разумный следующий шаг — пилот на собственных вопросах с одновременным замером точности, стоимости API и размера передаваемых деревьев. Работа меняет не выбор модели, а устройство доступа к знаниям вокруг неё.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



