Журнал · Rit.work

STAIR проверяет оглавление как индекс для RAG

Авторы STAIR предлагают искать по смысловой структуре документа, но пока метод проверен только на учебниках и не заменяет обычный поиск по фрагментам.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Группа авторов при участии IBM представила STAIR — систему поиска разделов в длинных документах; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, STAIR чаще ближайших альтернатив выбирает правильный раздел с первой попытки. Результат важен командам, которые строят RAG по технической документации, базам знаний, регламентам и другим материалам с устойчивой иерархией.

Что сделали

Обычный поиск для генерации с поисковым дополнением (RAG) часто начинает с нарезки документа на фрагменты заданной длины. Такая нарезка упрощает индексацию, но границы фрагментов могут не совпадать с границами тем: заголовок оказывается отдельно от объяснения, а соседние фрагменты конкурируют без учёта их положения в документе.

STAIR использует другой объект поиска — конечный узел оглавления, то есть раздел, который уже не делится на подразделы. На вход модель получает запрос и полное оглавление книги, а на выходе должна сгенерировать название раздела, где находится ответ. Иерархия даёт модели общий план корпуса и одновременно ограниченный набор осмысленных целей поиска.

Для обучения авторы собрали SearchTome. Исходными документами стали открытые учебники из образования, финансов, права, медицины, естественных и общественных наук. Из PDF извлекли оглавления и сопоставили их с текстом разделов. Затем Mixtral 8x7b сгенерировала вопросы по абзацам; раздел исходного абзаца стал правильной целью для поиска.

В основе STAIR лежит Mistral Instruct v0.2, дообученная с помощью LoRA — метода, при котором меняется небольшая добавка к весам модели, а не все параметры. Авторы сопоставили систему с DSI, который также хранит индекс в параметрах модели, но должен выучить идентификаторы разделов без оглавления во входных данных. Дополнительными ориентирами стали лексический поиск BM25 и плотный векторный поиск DPR.

Что показали

Главная метрика — полнота на первом месте: доля запросов, для которых правильный раздел оказался первым результатом. STAIR получила 82,6%, а дообученный DSI — 76,9%. Авторы измерили статистически значимую разницу во всех представленных предметных областях.

Плотный поиск DPR показал 68,7%, а BM25 — 59,5%. Однако DPR применялся без дообучения на SearchTome, поэтому это сравнение одновременно проверяет и архитектуру поиска, и преимущество корпусного обучения STAIR.

Авторы отдельно считали «галлюцинацией» генерацию названия, которого нет среди конечных разделов оглавления. По этому узкому определению доля таких ошибок у STAIR составила 0,05%. Это не означает, что последующая LLM будет давать фактически верные ответы: эксперимент проверяет выбор раздела, а не генерацию ответа по его содержимому.

Ограничения

SearchTome состоит из 18 книг в 6 областях. Это документы с заранее подготовленным и сравнительно чистым оглавлением. Работа не показывает, сохранится ли преимущество на корпоративных хранилищах с дублирующимися страницами, непоследовательными заголовками, разными версиями документов и правами доступа. Авторы сами относят проверку на крупных корпоративных наборах к дальнейшей работе.

Вопросы для обучения и тестирования сгенерированы моделью по абзацам тех же книг. Поэтому замер не воспроизводит полностью распределение реальных пользовательских запросов: короткие формулировки, ошибки в терминах, вопросы на сопоставление нескольких разделов и запросы, для которых ответа в корпусе нет.

Сравнение не охватывает современные гибридные схемы, где сначала выбирается глава, а затем выполняется векторный или лексический поиск внутри неё. Нет и замеров задержки, стоимости дообучения, обновления индекса или качества после изменения документов. STAIR проверена как поиск одного конечного раздела, а не как полный RAG-конвейер с извлечением фрагментов, формированием контекста и оценкой итогового ответа.

Что это значит

Работа не даёт оснований заменять действующий поиск по фрагментам на STAIR. Метод требует дообучения под корпус и предполагает, что у документов есть пригодная для поиска глобальная структура. Для часто меняющихся баз знаний параметрический индекс создаёт дополнительную задачу: после обновлений модель потребуется синхронизировать с содержимым.

Планы стоит скорректировать командам, у которых корпус уже организован как стабильное дерево: руководства по продукту, нормативные документы, учебные материалы или многоуровневая база поддержки. Вместо удаления заголовков при подготовке данных имеет смысл сохранять путь раздела, родительские заголовки и границы смысловых блоков. STAIR показывает, что эта структура может быть не только метаданными для фильтрации, но и отдельным сигналом для выбора области поиска.

Практический следующий шаг — не перенос архитектуры целиком, а сравнительный эксперимент на собственных запросах. Кандидатная схема может сначала выбирать ветку документа по иерархии, а затем искать конкретный абзац обычным способом. Такой вариант в статье не проверялся, но он позволяет использовать её основную идею без хранения всего поискового индекса в параметрах модели.

Итог для продуктовой команды ограниченный: структура документа заслуживает места в проектировании индекса, однако STAIR пока подтверждает это только на задаче маршрутизации запроса к разделу. Решения о смене поискового контура потребуют замеров на реальном корпусе, с настоящими запросами и оценкой конечных ответов.

Источники

Иллюстрация: рисунок из статьи «STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever for document structure augmentation», Vineet Kumar, Meghanadh Pulivarthi, vishwajeet kumar и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу