Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Настроенный под финансовые правила поиск стал заметно чаще находить нужные положения, но итоговая оценка ответов почти не отличила систему с документами от модели без них. В нерецензированном препринте University of Bonn, Lamarr-Institute, Universitat Rovira i Virgili и Fraunhofer IAIS, где все числа получили сами авторы, доля вопросов с правильным фрагментом в первой десятке выросла с 26% до 77%. Для продукта это разделяет две задачи: качество поиска уже можно измерять, а доказуемость ответа придётся проверять отдельно.
Как LegalBERT превратили в поисковую модель
Работа построена вокруг ObliQA — набора вопросов по правилам Abu Dhabi Global Market. Исходное разбиение допускало попадание фрагментов одного документа и в обучение, и в проверку, поэтому выборку заново разделили по документам. Так поисковая модель на тесте встречала положения, на которых её не обучали.
Поиск настраивали последовательно. Сначала вопрос превращали в утверждение, а LegalBERT учился восстанавливать скрытые слова этого утверждения по связанному с ним положению. Скрывали 80% слов, поэтому модель не могла решить задачу простым копированием и должна была сопоставлять смысл вопроса с правилом.
Затем модель обучали сближать вопрос с правильным фрагментом и отдалять от остальных фрагментов в той же учебной пачке. Специально подобранные сложные отрицательные примеры не использовали: в регуляторных документах похожий фрагмент часто оказывается ещё одним допустимым источником ответа, а не ошибочным результатом.
На последнем шаге смысловой поиск объединили с BM25, который ранжирует документы по совпадению слов. Это возвращает в выдачу точные номера правил, названия организаций и определённые термины, которые смысловая модель может недооценить. BM25 находил правильный фрагмент в первой десятке для 68% вопросов, а универсальная модель E5-large-v2 — для 76%; настроенная связка обошла обе.
Сами компоненты метода известны. Практический результат дала их последовательность: юридическая языковая модель сначала научилась распознавать поддержку утверждения, затем получила пригодное для поиска пространство представлений, а точные совпадения добавил отдельный словесный индекс.
Почему хороший поиск не гарантирует доказуемый ответ
Найденные фрагменты передавали компактным моделям размером от 2B до 12B параметров, запущенным с 4-битным представлением весов. Такой режим соответствует локальному развёртыванию, когда вопросы и внутренние документы нельзя отправлять внешнему поставщику.
Часть моделей дополнительно настраивали через RAFT-LoRA. Во время обучения они получали правильный фрагмент вместе с отвлекающими либо только отвлекающие материалы. Эталонные ответы создавал GPT-4o-mini, поэтому адаптеры перенимали не экспертную разметку, а манеру модели-учителя: перечислять найденные обязанности и отказываться от ответа при недостатке оснований.
Качество ответов измеряли RePASs. Эта составная метрика проверяет, следует ли ответ из контекста, противоречит ли он отдельным предложениям и покрывает ли перечисленные обязанности. Настройка улучшила оценку всех моделей, которые удалось стабильно адаптировать, особенно самой слабой.
Контрольный эксперимент показал, что такой рост нельзя считать доказательством опоры на документы. Модель без найденных фрагментов отстала от полной системы лишь на 0,011 балла RePASs, хотя писала правдоподобные общие формулировки, не приводила источники и искажала обязанности.
Метрика вознаграждала осторожный расплывчатый текст: он редко противоречит конкретному предложению и почти всегда похож хотя бы на часть правила. Наличие проверяемой ссылки на положение в оценку не входило. Поэтому высокий RePASs показывает форму ответа, но не подтверждает, что каждое утверждение связано с действующим требованием.
Что меняется в планах команд
Проверка охватывает два англоязычных публичных корпуса: правила Abu Dhabi Global Market и австралийские судебные материалы. Генерацию сравнивали на 150 вопросах для каждой конфигурации. Настроенные на коротких положениях адаптеры в основном не перенеслись на длинные судебные рассуждения, где вывод распределён по тексту и встречаются позиции, которые суд затем отвергает.
Для системы по одному устойчивому своду правил staged retrieval выглядит рабочей основой. Имеет смысл отдельно измерять, попало ли нужное положение в выдачу, а затем сохранять идентификаторы фрагментов и связывать с ними утверждения ответа. Увеличение общей оценки генератора не заменяет эту проверку.
Если продукт охватывает несколько юрисдикций или смешивает правила, судебные решения и внутренние политики, один адаптер нельзя закладывать в план как универсальный. Для каждого жанра потребуется собственная обучающая выборка и отдельная проверка переноса.
Критерий готовности тоже стоит разделить. Поиск проверяется полнотой выдачи, ответ — покрытием обязательных условий и отсутствием противоречий, а доказуемость — корректностью ссылок на конкретные положения. Контрольная модель без документов и экспертная проверка спорных ответов нужны как защита от метрики, которая принимает уверенный пересказ за работу с источником.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



