Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Arianna Miola, Bruno Spaccavento, Lorenzo Silotto, Marco Bianchetti и Luca Cagliero создали набор данных FinRAG-QA и проверили на нём RAG для банковской отчётности; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, выбранная конфигурация повысила NDCG@10 с 0,322 до 0,710. Результат важен командам, которые строят поиск показателей по длинным финансовым документам и выбирают между улучшением индекса, переранжированием и более сложной моделью генерации.
Что сделали
FinRAG-QA содержит 999 подготовленных финансовыми специалистами вопросов, связанных с 209 годовыми отчётами и документами Pillar 3 европейских и американских банков. Выборка охватывает 24 банка за пятилетний период. Вопросы требуют найти стандартизированный показатель для конкретного банка и года, а ответ привести в миллионах и в валюте исходного документа.
Авторы проверяли архитектуру генерации с поиском по источникам, или RAG: сначала система извлекает подходящие фрагменты документов, затем языковая модель формирует ответ только на основе найденного контекста. PDF обрабатывали через Microsoft Azure Document Intelligence, преобразовывали в Markdown и делили по иерархии заголовков. Фрагменты вместе с метаданными о банке, годе и типе отчёта сохраняли в Qdrant.
Основной эксперимент разделяет вклад компонентов. Для векторного поиска сравнивали OpenAI text-embedding-3-large и VoyageAI voyage-3-large. Отдельно проверяли контекстное обогащение: GPT-4.1 составляла для каждого фрагмента краткое описание его места в документе, после чего описание добавляли перед индексированием. Это должно компенсировать потерю смысла, возникающую при разрезании большого отчёта на части.
После первичного поиска авторы пробовали переранжирование: дополнительная модель повторно оценивала найденных кандидатов и меняла их порядок. На последнем этапе GPT-4o и GPT-o1-high извлекали итоговое числовое значение. Такая постановка позволяет увидеть, где именно возникает ошибка: документ не найден, нужный фрагмент расположен слишком низко или генератор неверно прочитал уже найденное значение.
Что показали
NDCG@10 измеряет качество порядка первых найденных фрагментов: оценка выше, если фрагмент с правильным ответом находится ближе к началу выдачи. Наибольший результат дала связка контекстного обогащения и VoyageAI voyage-3-large. Простое добавление заголовков почти не изменило поиск, поэтому в этой задаче синтетическое описание содержания оказалось полезнее структурных меток документа.
Переранжирование помогло конфигурации с контекстными представлениями OpenAI, но ухудшило результат варианта с VoyageAI. По интерпретации авторов, дополнительный этап может нарушать уже подходящий порядок кандидатов, если первичный поиск справляется лучше модели переранжирования. Следовательно, этот компонент нельзя считать обязательным улучшением RAG: его вклад нужно измерять после настройки основного поиска.
Среди запросов, для которых правильный фрагмент уже был найден, средняя точность GPT-o1-high составила 79,0% против 44,6% у GPT-4o. При этом генерация занимала примерно в 20 раз больше времени. Авторы также получили более точные ответы при передаче генератору только фрагмента с наивысшей позицией: расширение контекста добавляло шум и мешало выбрать нужное число.
Ограничения
Работа проверяет узкий сценарий: поиск простых значений стандартизированных банковских показателей. Эталонные ответы не требуют вычислять показатель из нескольких исходных величин. Поэтому результаты не показывают качество RAG для многошаговых расчётов, свободного анализа отчётности, диалога с уточнениями или документов из других отраслей.
Оценка генераторов проводилась только для запросов, где правильный фрагмент присутствовал в переданном контексте. Это изолирует способность модели извлечь число, но не даёт общей точности системы от исходного вопроса до ответа. Кроме того, сравнение охватывает ограниченный набор моделей и не включает денежную стоимость конфигураций, хотя авторы отмечают вычислительные затраты контекстного обогащения.
Эксперименты отражают модели, доступные к началу 2025 года. Авторы отдельно указывают, что недетерминированность GPT-o1-high осложняет воспроизводимость, необходимую для аудита финансовых систем. Взаимодействие переранжирования с разными моделями поиска также требует дополнительной проверки: проведённого сравнения недостаточно, чтобы отказаться от этого этапа во всех RAG-системах.
Что это значит
Работа меняет не выбор самой архитектуры, а порядок инженерных приоритетов. Для поиска по длинным финансовым документам сначала стоит проверить качество разбиения, контекстное обогащение фрагментов и модель векторного представления. Добавлять переранжирование по умолчанию не следует: отдельный этап увеличивает сложность конвейера и в проведённом эксперименте не улучшил наиболее точную поисковую конфигурацию.
Результаты также поддерживают раздельную оптимизацию полноты поиска и точности генерации. Поисковой части может потребоваться несколько кандидатов, чтобы не пропустить источник, но генератору необязательно передавать их все. Практический вариант — сохранять расширенную выдачу для проверки и ссылок на источник, а ответ строить по наиболее подходящему фрагменту.
Модель с рассуждением оправдана там, где ошибка в финансовом показателе важнее задержки ответа. Для интерактивного интерфейса или массовой обработки её время работы может стать ограничением. Поэтому планы команды стоит менять через собственное поэтапное тестирование: отдельно измерять извлечение, влияние переранжирования, итоговую точность и задержку, а не сравнивать только готовые RAG-конвейеры целиком.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



