Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новый способ поиска помогает RAG собирать ответ из нескольких связанных документов без дорогой подготовки корпуса. В нерецензированном препринте Gianluca Bonifazi и соавторов все числа получили сами авторы: задержка запроса у MatRAG оказалась более чем на 35,14% ниже, чем у NaiveRAG. Вместо выбора между плоским поиском и сложным графом знаний команда может проверить промежуточную архитектуру — иерархический индекс без LLM-резюме.
Короткие векторы ведут к подробным документам
Обычный векторный поиск сравнивает вопрос со всеми документами в одном пространстве. Он хорошо находит прямое совпадение, но может пропустить цепочку: один документ содержит исходный факт, второй связывает его с сущностью, а третий даёт ответ.
MatRAG организует документы в направленный ациклический граф. Внизу лежат сами документы, выше — всё более крупные смысловые кластеры. Один документ может входить в несколько родительских кластеров, поэтому ошибочный выбор на одном пути не всегда закрывает доступ к нему.
Для индекса используют вложенные представления Matryoshka. Модель один раз строит полный вектор документа, а его начальные части работают как самостоятельные векторы меньшей размерности. Верхние уровни хранят короткие представления, а уровень документов — полные.
При запросе система спускается от общих кластеров к конкретным документам. На верхних уровнях она сравнивает короткие векторы и тратит меньше вычислений; точное сравнение оставляет до конца. Внутренние узлы содержат средние векторы дочерних элементов, а не резюме, созданные LLM. Поэтому при индексации не нужно строить граф сущностей и отношений или многократно вызывать генеративную модель.
Сущности заменяют планировщик на основе LLM
Одной иерархии недостаточно для вопроса, который требует нескольких переходов между фактами. MatRAG извлекает именованные сущности из вопроса и найденных документов, а затем использует новые сущности как сигнал для следующего шага поиска.
Число новых сущностей задаёт, сколько дополнительных документов можно забрать на очередной итерации. Кандидаты получают оценку одновременно за смысловую близость и за пересечение сущностей. Такой механизм заменяет планировщик, который в других системах разбивает вопрос на шаги с помощью повторных вызовов LLM.
Добавление найденных документов к запросу создаёт риск смыслового дрейфа: система может постепенно уйти от исходного вопроса вслед за случайно выбранным текстом. MatRAG смешивает оценку расширенного контекста с оценкой исходного запроса и усиливает роль последнего по мере расходования поискового бюджета.
Метод проверили на трёх наборах многошаговых вопросов — HotpotQA, 2WikiMultiHopQA и MuSiQue — в сравнении с семью поисковыми системами. MatRAG показал лучший результат по точному совпадению ответа и метрике F1 на всех наборах. На HotpotQA полнота среди первых пяти документов выросла с 86,72% при полных векторах до 89,30% при коротких Matryoshka-представлениях: сокращение размерности здесь не ухудшило поиск, а отсеяло лишний сигнал.
Архитектурный выбор меняется на этапе прототипа
Работа меняет планы команд, которые собирались внедрять GraphRAG или иерархию с LLM-резюме только ради вопросов по цепочке документов. MatRAG предлагает сначала проверить более простую схему: Matryoshka-модель для векторов, плотностную кластеризацию, извлечение сущностей и спуск по иерархии. Дополнительное обучение для этого не требуется.
Экономия возникает в двух местах. При подготовке корпуса система считает центроиды вместо генерации резюме и не извлекает отношения для отдельного графа знаний. При запросе она сравнивает короткие векторы на крупных уровнях и не вызывает LLM для планирования каждого перехода. Генеративная модель остаётся в конце конвейера и формирует ответ по найденным документам.
Проверка пока охватывает многошаговые вопросы на трёх исследовательских наборах, а не производственные корпуса с собственными форматами и терминологией. Качество зависит от GLiNER: пропущенные или ошибочные сущности влияют и на число итераций, и на порядок документов. На корпусе с равномерно похожими текстами кластеры могут разделяться плохо.
Есть и структурный риск: спуск идёт жадно и не возвращается к отброшенной ветке. Несколько родителей для одного узла создают запасные пути, но не исправляют ошибку, если нужный документ не попал ни в один выбранный кластер. Поэтому MatRAG разумно рассматривать как отдельный вариант поискового прототипа и сравнивать с плоским индексом на реальных вопросах продукта, прежде чем заменять существующий контур.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



