Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Группа авторов при участии IBM представила STAIR — систему поиска разделов в длинных документах; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, STAIR чаще ближайших альтернатив выбирает правильный раздел с первой попытки. Результат важен командам, которые строят RAG по технической документации, базам знаний, регламентам и другим материалам с устойчивой иерархией.
Что сделали
Обычный поиск для генерации с поисковым дополнением (RAG) часто начинает с нарезки документа на фрагменты заданной длины. Такая нарезка упрощает индексацию, но границы фрагментов могут не совпадать с границами тем: заголовок оказывается отдельно от объяснения, а соседние фрагменты конкурируют без учёта их положения в документе.
STAIR использует другой объект поиска — конечный узел оглавления, то есть раздел, который уже не делится на подразделы. На вход модель получает запрос и полное оглавление книги, а на выходе должна сгенерировать название раздела, где находится ответ. Иерархия даёт модели общий план корпуса и одновременно ограниченный набор осмысленных целей поиска.
Для обучения авторы собрали SearchTome. Исходными документами стали открытые учебники из образования, финансов, права, медицины, естественных и общественных наук. Из PDF извлекли оглавления и сопоставили их с текстом разделов. Затем Mixtral 8x7b сгенерировала вопросы по абзацам; раздел исходного абзаца стал правильной целью для поиска.
В основе STAIR лежит Mistral Instruct v0.2, дообученная с помощью LoRA — метода, при котором меняется небольшая добавка к весам модели, а не все параметры. Авторы сопоставили систему с DSI, который также хранит индекс в параметрах модели, но должен выучить идентификаторы разделов без оглавления во входных данных. Дополнительными ориентирами стали лексический поиск BM25 и плотный векторный поиск DPR.
Что показали
Главная метрика — полнота на первом месте: доля запросов, для которых правильный раздел оказался первым результатом. STAIR получила 82,6%, а дообученный DSI — 76,9%. Авторы измерили статистически значимую разницу во всех представленных предметных областях.
Плотный поиск DPR показал 68,7%, а BM25 — 59,5%. Однако DPR применялся без дообучения на SearchTome, поэтому это сравнение одновременно проверяет и архитектуру поиска, и преимущество корпусного обучения STAIR.
Авторы отдельно считали «галлюцинацией» генерацию названия, которого нет среди конечных разделов оглавления. По этому узкому определению доля таких ошибок у STAIR составила 0,05%. Это не означает, что последующая LLM будет давать фактически верные ответы: эксперимент проверяет выбор раздела, а не генерацию ответа по его содержимому.
Ограничения
SearchTome состоит из 18 книг в 6 областях. Это документы с заранее подготовленным и сравнительно чистым оглавлением. Работа не показывает, сохранится ли преимущество на корпоративных хранилищах с дублирующимися страницами, непоследовательными заголовками, разными версиями документов и правами доступа. Авторы сами относят проверку на крупных корпоративных наборах к дальнейшей работе.
Вопросы для обучения и тестирования сгенерированы моделью по абзацам тех же книг. Поэтому замер не воспроизводит полностью распределение реальных пользовательских запросов: короткие формулировки, ошибки в терминах, вопросы на сопоставление нескольких разделов и запросы, для которых ответа в корпусе нет.
Сравнение не охватывает современные гибридные схемы, где сначала выбирается глава, а затем выполняется векторный или лексический поиск внутри неё. Нет и замеров задержки, стоимости дообучения, обновления индекса или качества после изменения документов. STAIR проверена как поиск одного конечного раздела, а не как полный RAG-конвейер с извлечением фрагментов, формированием контекста и оценкой итогового ответа.
Что это значит
Работа не даёт оснований заменять действующий поиск по фрагментам на STAIR. Метод требует дообучения под корпус и предполагает, что у документов есть пригодная для поиска глобальная структура. Для часто меняющихся баз знаний параметрический индекс создаёт дополнительную задачу: после обновлений модель потребуется синхронизировать с содержимым.
Планы стоит скорректировать командам, у которых корпус уже организован как стабильное дерево: руководства по продукту, нормативные документы, учебные материалы или многоуровневая база поддержки. Вместо удаления заголовков при подготовке данных имеет смысл сохранять путь раздела, родительские заголовки и границы смысловых блоков. STAIR показывает, что эта структура может быть не только метаданными для фильтрации, но и отдельным сигналом для выбора области поиска.
Практический следующий шаг — не перенос архитектуры целиком, а сравнительный эксперимент на собственных запросах. Кандидатная схема может сначала выбирать ветку документа по иерархии, а затем искать конкретный абзац обычным способом. Такой вариант в статье не проверялся, но он позволяет использовать её основную идею без хранения всего поискового индекса в параметрах модели.
Итог для продуктовой команды ограниченный: структура документа заслуживает места в проектировании индекса, однако STAIR пока подтверждает это только на задаче маршрутизации запроса к разделу. Решения о смене поискового контура потребуют замеров на реальном корпусе, с настоящими запросами и оценкой конечных ответов.
Источники
Иллюстрация: рисунок из статьи «STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever for document structure augmentation», Vineet Kumar, Meghanadh Pulivarthi, vishwajeet kumar и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



