Журнал · Rit.work

MatRAG удешевляет многошаговый RAG без графа знаний

MatRAG строит иерархический индекс из вложенных векторов, ищет цепочки фактов без графа знаний и сокращает задержку по сравнению с обычным RAG.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Новый способ поиска помогает RAG собирать ответ из нескольких связанных документов без дорогой подготовки корпуса. В нерецензированном препринте Gianluca Bonifazi и соавторов все числа получили сами авторы: задержка запроса у MatRAG оказалась более чем на 35,14% ниже, чем у NaiveRAG. Вместо выбора между плоским поиском и сложным графом знаний команда может проверить промежуточную архитектуру — иерархический индекс без LLM-резюме.

Короткие векторы ведут к подробным документам

Обычный векторный поиск сравнивает вопрос со всеми документами в одном пространстве. Он хорошо находит прямое совпадение, но может пропустить цепочку: один документ содержит исходный факт, второй связывает его с сущностью, а третий даёт ответ.

MatRAG организует документы в направленный ациклический граф. Внизу лежат сами документы, выше — всё более крупные смысловые кластеры. Один документ может входить в несколько родительских кластеров, поэтому ошибочный выбор на одном пути не всегда закрывает доступ к нему.

Для индекса используют вложенные представления Matryoshka. Модель один раз строит полный вектор документа, а его начальные части работают как самостоятельные векторы меньшей размерности. Верхние уровни хранят короткие представления, а уровень документов — полные.

При запросе система спускается от общих кластеров к конкретным документам. На верхних уровнях она сравнивает короткие векторы и тратит меньше вычислений; точное сравнение оставляет до конца. Внутренние узлы содержат средние векторы дочерних элементов, а не резюме, созданные LLM. Поэтому при индексации не нужно строить граф сущностей и отношений или многократно вызывать генеративную модель.

Сущности заменяют планировщик на основе LLM

Одной иерархии недостаточно для вопроса, который требует нескольких переходов между фактами. MatRAG извлекает именованные сущности из вопроса и найденных документов, а затем использует новые сущности как сигнал для следующего шага поиска.

Число новых сущностей задаёт, сколько дополнительных документов можно забрать на очередной итерации. Кандидаты получают оценку одновременно за смысловую близость и за пересечение сущностей. Такой механизм заменяет планировщик, который в других системах разбивает вопрос на шаги с помощью повторных вызовов LLM.

Добавление найденных документов к запросу создаёт риск смыслового дрейфа: система может постепенно уйти от исходного вопроса вслед за случайно выбранным текстом. MatRAG смешивает оценку расширенного контекста с оценкой исходного запроса и усиливает роль последнего по мере расходования поискового бюджета.

Метод проверили на трёх наборах многошаговых вопросов — HotpotQA, 2WikiMultiHopQA и MuSiQue — в сравнении с семью поисковыми системами. MatRAG показал лучший результат по точному совпадению ответа и метрике F1 на всех наборах. На HotpotQA полнота среди первых пяти документов выросла с 86,72% при полных векторах до 89,30% при коротких Matryoshka-представлениях: сокращение размерности здесь не ухудшило поиск, а отсеяло лишний сигнал.

Архитектурный выбор меняется на этапе прототипа

Работа меняет планы команд, которые собирались внедрять GraphRAG или иерархию с LLM-резюме только ради вопросов по цепочке документов. MatRAG предлагает сначала проверить более простую схему: Matryoshka-модель для векторов, плотностную кластеризацию, извлечение сущностей и спуск по иерархии. Дополнительное обучение для этого не требуется.

Экономия возникает в двух местах. При подготовке корпуса система считает центроиды вместо генерации резюме и не извлекает отношения для отдельного графа знаний. При запросе она сравнивает короткие векторы на крупных уровнях и не вызывает LLM для планирования каждого перехода. Генеративная модель остаётся в конце конвейера и формирует ответ по найденным документам.

Проверка пока охватывает многошаговые вопросы на трёх исследовательских наборах, а не производственные корпуса с собственными форматами и терминологией. Качество зависит от GLiNER: пропущенные или ошибочные сущности влияют и на число итераций, и на порядок документов. На корпусе с равномерно похожими текстами кластеры могут разделяться плохо.

Есть и структурный риск: спуск идёт жадно и не возвращается к отброшенной ветке. Несколько родителей для одного узла создают запасные пути, но не исправляют ошибку, если нужный документ не попал ни в один выбранный кластер. Поэтому MatRAG разумно рассматривать как отдельный вариант поискового прототипа и сравнивать с плоским индексом на реальных вопросах продукта, прежде чем заменять существующий контур.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу