Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Финансовая LLM стала увереннее писать профессиональные сводки, но почти перестала воздерживаться от чисел, которых нет в исходном документе. Хотя препринт Xiaodong Li и Peiwei Liu не прошёл рецензирование и все числа получили сами авторы, доля самых заметных числовых галлюцинаций выросла с 5,4% у базовой модели до 90,8% у версии с финансовыми и арифметическими данными. Для команд, которые донастраивают модели под отрасль, это переносит проверку с умения считать на умение не выдумывать.
Как отделили ошибку в расчёте от привычки вставлять числа
Авторы взяли Mistral-7B-Instruct-v0.2 и сравнили исходную модель с двумя вариантами. FT-A донастроили на языке финансовых документов, а FT-A+B+C дополнительно обучили отвечать на финансовые вопросы и решать задачи с числами. Архитектура не менялась: новые навыки добавляли через QLoRA, то есть настройку небольшой части параметров поверх исходной модели.
Проверка охватила 240 заданий на составление финансовых сводок: 160 синтетических примеров и 80 фрагментов годовых отчётов 10-K. В части входных текстов были абсолютные показатели, а в части — только общие описания или относительные изменения. Второй случай проверял числовую дисциплину: модель должна была не придумывать сумму, если документ её не давал.
Ошибки разделили по тому, насколько трудно их заметить. Открытая галлюцинация — выдуманная сумма с обозначением валюты. Скрытая явная — правдоподобное число в профессиональном формате, например темп роста без опоры на источник. Скрытая неявная — количественный вывод вроде «долговая нагрузка оставалась стабильной», хотя исходный текст этого не подтверждает.
Такое разделение важно для приёмки. Регулярное выражение найдёт сумму с символом валюты, но пропустит неподтверждённый процент или словесное утверждение о стабильности. Автоматическую разметку в работе дополнительно сверяли с оценками людей.
Финансовый стиль оказался сильнее опоры на документ
У FT-A доля ответов с открытыми числовыми галлюцинациями достигла 82,5%. Дополнительные задания на арифметику не исправили поведение: у FT-A+B+C показатель вырос ещё на 7,9 процентного пункта. Модель лучше воспроизводила форму финансового анализа, но чаще заполняла эту форму неподтверждёнными значениями.
Причиной оказался не только больший объём обучения. В отдельном опыте авторы выровняли объём данных, но оставили только материалы того же типа, что использовались для FT-A. Галлюцинации не усилились, поэтому различие связано прежде всего с содержанием дополнительных заданий, а не с количеством примеров.
В ответах повторялись одни и те же заготовки на несвязанных входных документах. Например, модель вставляла «USD 3.3 billion» как готовый элемент финансового рассказа. Донастройка закрепила не правило «возьми число из источника», а шаблон «в профессиональной сводке должна быть сумма».
Эксперимент проверяет одну модель с семью миллиардами параметров, один способ донастройки и задачу финансового реферирования на подготовленном наборе. Он не показывает, насколько часто тот же механизм возникает у более крупных моделей или в производственном потоке документов, но предлагает проверку, которую можно перенести на другие стеки.
Приёмка должна проверять отказ от числа, а не только арифметику
Работа не требует отказаться от доменной донастройки: она показывает, что тестов на терминологию, стиль и правильные вычисления недостаточно. В набор для приёмки стоит добавить документы без абсолютных показателей и считать ошибкой любое число, которое модель не может связать с конкретным фрагментом источника.
Проверять нужно все три класса ошибок. Форматный фильтр может отсеять выдуманные суммы с валютой, но для процентов, сравнений и словесных количественных выводов потребуется сверка с исходным документом. Отдельный тест должен искать повторяющиеся значения и формулировки в ответах на несвязанные документы: так проявляется вставка заученного шаблона.
В архитектуре продукта безопаснее разделить извлечение фактов и написание сводки. Модель получает только подтверждённые показатели, у каждого значения сохраняется ссылка на фрагмент документа, а при слабой опоре система разрешает пропустить число или отказаться от вывода. Именно такого механизма в обучающих данных эксперимента не было: модель учили считать, но не учили определять, когда считать нельзя.
Если финансовую LLM уже донастраивают, планы меняются на этапе оценки и выпуска. Сравнивать новую версию нужно не только с предыдущей доменной моделью, но и с исходной: улучшение профессионального языка может скрывать ухудшение числовой дисциплины. До такой проверки арифметический бенчмарк не служит достаточным основанием для допуска модели к сводкам отчётности.
Источники
Иллюстрация: рисунок из статьи «When Financial Fine-tuning Fails: A Three-Level Detectability Analysis of Numerical Hallucination in Domain-Adapted Language Models», Xiaodong Li, Peiwei Liu, CC BY-SA 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



