Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
На шаблонных деловых документах локальная модель может извлекать поля точнее универсального облачного сервиса. В препринте John Hancock, который не прошёл рецензирование и приводит числа, полученные самими авторами, дообученные Qwen обошли коммерческие модели без настройки. Это делает собственную модель рабочим вариантом для стабильных форм, но не отменяет API: при малом объёме они остаются проще и дешевле.
Как сравнили OCR, облачные API и локальные модели
Модели получали изображение банковского чека и возвращали JSON с получателем, суммой, датой и банком. Для всех систем использовали одинаковую инструкцию, схему ответа и тестовый набор из 750 документов.
В сравнении участвовали четыре класса решений. OCR с регулярными выражениями служил нижней границей без LLM. Гибрид OCR+GPT сначала распознавал текст, затем передавал его языковой модели. Коммерческие GPT-4.1, GPT-5, Claude Sonnet 4.5 и Azure Content Understanding работали без дообучения. Qwen и SmolVLM запускали локально как в исходном виде, так и после настройки на 2 998 примерах.
Основная метрика F1 сводит в одну оценку долю найденных правильных значений и долю правильных значений среди всех ответов модели. Отдельно проверяли, полностью ли заполнен документ, всегда ли модель выдаёт корректный JSON и сколько времени занимает обработка.
Чеки были синтетическими: значения и фоны тестовой части не пересекались с обучающей, однако структура документов оставалась шаблонной. Дополнительные проверки охватывали индийские чеки с другим форматом и страховые анкеты. Они показали границу переноса: один из Qwen выучил год из обучающего набора и подставлял его во все ответы на новых чеках, а на страховой форме набор подходящих моделей изменился.
Дообучение исправило не только значения, но и формат ответа
Лучший результат показал дообученный Qwen2.5-VL-7B: F1 достиг 0,985 против 0,928 у лидера коммерческой группы GPT-5. Младший Qwen почти сравнялся со старшим, а разница между ними оказалась в пределах погрешности. Для узкой схемы дополнительные параметры практически не улучшили качество.
Разрыв заметнее на уровне целого документа. Qwen правильно заполнил все поля в 88,9% случаев, тогда как GPT-5 — в 41,7%. Высокая оценка по отдельным полям поэтому не гарантирует, что документ можно отправить дальше без проверки.
Коммерческие модели чаще всего ошибались на дате. У Claude Sonnet 4.5 F1 по этому полю упал до 0,468: модель находила почти все нужные даты, но добавляла другие похожие фрагменты со страницы. Изменения инструкции почти не помогли, тогда как дообученные Qwen научились копировать значение из нужной области.
Для самых маленьких SmolVLM настройка решила другую проблему: исходные модели зацикливались при генерации и не завершали JSON. После дообучения они стали пригодны для экспериментов, но ошибки формата сохранились. Это важно для конвейера: неверный JSON останавливает обработку независимо от того, правильно ли модель распознала текст.
Когда работа меняет архитектурный план
Сравнение предлагает сначала отсеивать неподходящие решения, а не выбирать победителя по F1. Система должна пройти требования к хранению данных, качеству каждого важного поля, корректности JSON и допустимой задержке. Только среди оставшихся вариантов имеет смысл считать полную стоимость разработки и эксплуатации.
Локальная модель выигрывает, когда шаблон стабилен, доступны размеченные документы и данные нельзя отправлять во внешний API. В измерениях Qwen обрабатывал документ за 3,53 секунды на выделенной A100, а GPT-5 отвечал через API за 26,3 секунды. Это не универсальная гарантия скорости: условия запуска различались, а результат локальной модели зависит от GPU, размера пакета и загрузки сервера.
API разумнее для прототипа, меняющихся форм и небольшого потока. Они не требуют готовить обучающий набор, поддерживать GPU и заново настраивать модель после изменения схемы. В иллюстративном расчёте статьи самостоятельное размещение начинало окупаться примерно после 440 тысяч документов в месяц; эта граница зависит от тарифа, зарплат команды и того, можно ли делить сервер между продуктами.
Обычный OCR с регулярными выражениями остаётся вариантом для предельно стабильной разметки и простых полей, но в этом эксперименте он заметно уступил всем дообученным моделям. Гибрид OCR+LLM выглядит практичным промежуточным решением: он дешевле старших мультимодальных API и не требует собственного обучения, хотя сохраняет зависимость от внешних сервисов.
Работа меняет план не в сторону обязательного перехода на Qwen, а в сторону собственного испытательного набора. Команде стоит собрать документы с реальными поворотами, шумом и вариантами шаблона, задать пороги для критичных полей и учитывать неверный JSON как полный отказ. Только после такого фильтра сравнение цены API и локального запуска отражает производственную задачу, а не рейтинг на синтетических чеках.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



