Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Извлечённые из финансовых документов поля научились автоматически принимать так, чтобы заранее ограничить долю ошибок в принятой группе. В препринте OCBC, который не прошёл рецензирование и содержит замеры самих авторов, новая схема пропустила в автоматический контур как минимум в семь раз больше полей, чем собственная оценка уверенности модели. Для внедрения это меняет архитектуру: полагаться нужно не на одно число от VLM, а на отдельный проверяющий слой.
Уверенность складывают из изображения, расположения и правил
Визуально-языковая модель (VLM) получает страницу и список полей, а возвращает значения вроде даты, суммы или номера счёта. Её собственная уверенность плохо показывает, верен ли ответ: модель может несколько раз одинаково прочитать неверное значение и каждый раз оценить его высоко.
Предложенный слой сначала связывает ответ с конкретным местом на странице. OCR находит текстовые фрагменты и их координаты, после чего система ищет фрагмент, совпадающий с нормализованным ответом VLM. Если значения на странице нет или оно встречается в нескольких местах, это влияет на итоговую оценку.
Канал восприятия проверяет, можно ли надёжно прочитать найденную область. Он учитывает качество изображения, размер символов, похожие знаки вроде нуля и буквы O, а также расхождение между OCR и ответом VLM.
Канал расположения сравнивает документ с историческими шаблонами. Система находит похожие страницы и проверяет, находится ли значение там, где поле этого типа располагалось раньше. Координаты считают относительно ближайшей подписи, поэтому перенос шаблона по странице или изменение масштаба не должны ломать проверку.
Канал валидации применяет форматы, контрольные суммы и арифметические связи между полями. Он также проверяет, совпал ли результат со второй независимой VLM. Все признаки объединяет LightGBM, который выдаёт вероятность правильного ответа и позволяет показать причины решения: незнакомый шаблон, необычное положение, расхождение моделей или плохое совпадение с OCR.
Порог ограничивает ошибки среди автоматически принятых полей
Откалиброванная вероятность сама по себе ещё не задаёт безопасное решение. Поверх неё работает конформный контроль риска: на отложенных примерах система подбирает порог, при котором ошибка среди автоматически принятых полей укладывается в установленный оператором предел. Всё, что не прошло порог, отправляется человеку.
При целевой ошибке не выше 10% собственная уверенность VLM позволяла автоматически принять лишь 0,1–7% полей. Полная схема принимала 49–72%. Лимит относится именно к принятой группе: метод не обещает безошибочность каждого значения, а контролирует совокупную долю неверных решений.
Вторая модель нужна не только как сигнал согласия. Когда две VLM возвращают разные значения, система оценивает каждый вариант и выбирает более надёжный вместо автоматического отказа. Это повышает долю документов без ручной проверки, но требует отдельного вызова второй модели и поддержки двух независимых трактов извлечения.
Планы меняются, если автоматическое принятие было частью продукта
Работа предлагает не замену экстрактору, а обвязку вокруг него. В производственной схеме понадобятся OCR с координатами, индекс исторических макетов, правила для отдельных типов полей, размеченные правильные ответы для обучения и отдельный набор для выбора порога. Поэтому встроить такой контроль как один дополнительный запрос к VLM не получится.
Подход проверяли на трёх публичных коллекциях: реальных счетах DocILE, синтетических счетах FATURA и формах заказа рекламы VRDU. Эксперименты провели с двумя семействами моделей — Qwen3.6-27B и Gemini-3.1-Flash-Lite. Обучающие документы для индекса макетов не пересекались с материалами, на которых оценивали результат.
Сильнее всего схема подходит потокам с повторяющимися контрагентами и формами. Для нового шаблона канал расположения откатывается к общей статистике, поэтому решение сильнее зависит от качества изображения, OCR и проверочных правил. После появления похожих проверенных документов шаблон можно добавить в индекс.
Команде, которая планировала только извлечение и ручную проверку всех результатов, работа даёт направление для следующего этапа, но не готовый универсальный компонент. Главная инженерная задача смещается с выбора VLM на сбор подтверждённых полей, поддержку шаблонов и регулярную перекалибровку порога. Если же продукт должен лишь заполнять черновик для оператора, такой контур добавит инфраструктуру, не устраняя обязательный человеческий шаг.
Источники
Иллюстрация: рисунок из статьи «Perception, Layout, and Validation: Calibrated Confidence for Reliable Straight-Through Processing of Financial Documents», Yichao Jin, Yushuo Wang, Yuxuan Han и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



