Журнал · Rit.work

Донастройка Mistral под финансы резко увеличила числовые галлюцинации

Эксперимент с Mistral-7B показал, что финансовая донастройка улучшает форму сводок, но может приучить модель вставлять неподтверждённые суммы и показатели.

Rit.work
Студия разработки
7 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Финансовая LLM стала увереннее писать профессиональные сводки, но почти перестала воздерживаться от чисел, которых нет в исходном документе. Хотя препринт Xiaodong Li и Peiwei Liu не прошёл рецензирование и все числа получили сами авторы, доля самых заметных числовых галлюцинаций выросла с 5,4% у базовой модели до 90,8% у версии с финансовыми и арифметическими данными. Для команд, которые донастраивают модели под отрасль, это переносит проверку с умения считать на умение не выдумывать.

Как отделили ошибку в расчёте от привычки вставлять числа

Авторы взяли Mistral-7B-Instruct-v0.2 и сравнили исходную модель с двумя вариантами. FT-A донастроили на языке финансовых документов, а FT-A+B+C дополнительно обучили отвечать на финансовые вопросы и решать задачи с числами. Архитектура не менялась: новые навыки добавляли через QLoRA, то есть настройку небольшой части параметров поверх исходной модели.

Проверка охватила 240 заданий на составление финансовых сводок: 160 синтетических примеров и 80 фрагментов годовых отчётов 10-K. В части входных текстов были абсолютные показатели, а в части — только общие описания или относительные изменения. Второй случай проверял числовую дисциплину: модель должна была не придумывать сумму, если документ её не давал.

Ошибки разделили по тому, насколько трудно их заметить. Открытая галлюцинация — выдуманная сумма с обозначением валюты. Скрытая явная — правдоподобное число в профессиональном формате, например темп роста без опоры на источник. Скрытая неявная — количественный вывод вроде «долговая нагрузка оставалась стабильной», хотя исходный текст этого не подтверждает.

Такое разделение важно для приёмки. Регулярное выражение найдёт сумму с символом валюты, но пропустит неподтверждённый процент или словесное утверждение о стабильности. Автоматическую разметку в работе дополнительно сверяли с оценками людей.

Финансовый стиль оказался сильнее опоры на документ

У FT-A доля ответов с открытыми числовыми галлюцинациями достигла 82,5%. Дополнительные задания на арифметику не исправили поведение: у FT-A+B+C показатель вырос ещё на 7,9 процентного пункта. Модель лучше воспроизводила форму финансового анализа, но чаще заполняла эту форму неподтверждёнными значениями.

Причиной оказался не только больший объём обучения. В отдельном опыте авторы выровняли объём данных, но оставили только материалы того же типа, что использовались для FT-A. Галлюцинации не усилились, поэтому различие связано прежде всего с содержанием дополнительных заданий, а не с количеством примеров.

В ответах повторялись одни и те же заготовки на несвязанных входных документах. Например, модель вставляла «USD 3.3 billion» как готовый элемент финансового рассказа. Донастройка закрепила не правило «возьми число из источника», а шаблон «в профессиональной сводке должна быть сумма».

Эксперимент проверяет одну модель с семью миллиардами параметров, один способ донастройки и задачу финансового реферирования на подготовленном наборе. Он не показывает, насколько часто тот же механизм возникает у более крупных моделей или в производственном потоке документов, но предлагает проверку, которую можно перенести на другие стеки.

Приёмка должна проверять отказ от числа, а не только арифметику

Работа не требует отказаться от доменной донастройки: она показывает, что тестов на терминологию, стиль и правильные вычисления недостаточно. В набор для приёмки стоит добавить документы без абсолютных показателей и считать ошибкой любое число, которое модель не может связать с конкретным фрагментом источника.

Проверять нужно все три класса ошибок. Форматный фильтр может отсеять выдуманные суммы с валютой, но для процентов, сравнений и словесных количественных выводов потребуется сверка с исходным документом. Отдельный тест должен искать повторяющиеся значения и формулировки в ответах на несвязанные документы: так проявляется вставка заученного шаблона.

В архитектуре продукта безопаснее разделить извлечение фактов и написание сводки. Модель получает только подтверждённые показатели, у каждого значения сохраняется ссылка на фрагмент документа, а при слабой опоре система разрешает пропустить число или отказаться от вывода. Именно такого механизма в обучающих данных эксперимента не было: модель учили считать, но не учили определять, когда считать нельзя.

Если финансовую LLM уже донастраивают, планы меняются на этапе оценки и выпуска. Сравнивать новую версию нужно не только с предыдущей доменной моделью, но и с исходной: улучшение профессионального языка может скрывать ухудшение числовой дисциплины. До такой проверки арифметический бенчмарк не служит достаточным основанием для допуска модели к сводкам отчётности.

Источники

Иллюстрация: рисунок из статьи «When Financial Fine-tuning Fails: A Three-Level Detectability Analysis of Numerical Hallucination in Domain-Adapted Language Models», Xiaodong Li, Peiwei Liu, CC BY-SA 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу