Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Для локального извлечения данных нельзя выбрать один лучший формат входа: на формах выигрывает изображение страницы, а на почти линейных документах — распознанный текст. Пакетная обработка снизила расход энергии на страницу на 38–85% без потери точности; препринт не проходил рецензирование, и все числа в нём получили сами авторы. Для локального контура это переносит главный архитектурный выбор с модели на тип документа и способ подачи данных.
Изображение сохраняет связи, которые теряет обычный текст
В формах значение поля часто определяется положением: подпись находится слева, сумма — в соседней ячейке, а дата относится к конкретному блоку. Если сначала превратить такую страницу в последовательность строк, часть этих связей исчезнет или попадёт в текст в неверном порядке.
На структурированных формах VRDU лучше показали себя Qwen3-VL и NuExtract, которые читают страницу как изображение. Это не универсальное преимущество зрительно-языковых моделей: оно появляется там, где расположение элементов несёт часть смысла.
На договорах Kleister-NDA ситуация перевернулась. В них текст идёт почти линейно, поэтому небольшая текстовая модель с дешёвым парсером извлекала данные точнее и тратила меньше энергии, чем любой проверенный вариант со зрительным анализом. Обработка изображения здесь заставляет модель разбирать визуальную структуру, которая почти ничего не добавляет к содержанию.
Способ получить текст тоже меняет результат. Для документов со встроенным текстовым слоем подходит парсер, который читает его напрямую. Для сканов нужен OCR, но нейросетевой DeepSeek-OCR 2 расходовал в 17 раз больше энергии на страницу, чем классический Tesseract, и ни разу не оказался среди вариантов, где улучшить точность можно только ценой роста энергозатрат.
Пакет запросов важнее перехода на FP8
Пакетная обработка объединяет несколько запросов, чтобы GPU реже простаивал между короткими задачами. Она не меняет содержание запроса и ответ модели, поэтому точность осталась прежней, а энергия на одну страницу снизилась за счёт лучшей загрузки оборудования.
Переход с FP16 на восьмибитный формат FP8 сильнее помогал при обработке запросов по одному: экономия составила 27–32%. После объединения запросов в пакеты оставшийся выигрыш опустился ниже 1 мВт·ч на страницу, или до 9–19%. Поэтому начинать оптимизацию локального сервиса с формата чисел невыгодно, если GPU ещё простаивает из-за последовательной очереди.
Авторы считали энергию всей цепочки: подготовку документа и работу модели. Это существенно, потому что после настройки пакетной обработки именно парсер может определять основную часть расхода. Замер только генерации скроет цену OCR и способен привести к выбору более дорогой системы.
Командам нужен не один конвейер, а две ветки
Работа меняет планы команд, которые собирались пропускать все документы через одну зрительно-языковую модель. Для однородного потока договоров разумнее оставить текстовую ветку: извлечь встроенный текст или применить недорогой OCR, затем передать результат небольшой текстовой модели. Для форм, таблиц и регистрационных бланков нужна ветка, которая сохраняет страницу как изображение.
Если продукт обрабатывает оба типа документов, выбор ветки стоит делать до запуска модели. После этого следует подобрать парсер на собственных файлах, включить пакетную обработку и только затем проверять FP8. Такой порядок отделяет архитектурный выигрыш от небольшой оптимизации уже загруженного GPU.
Проверка охватывала два англоязычных набора документов, модели размером не более 8 млрд параметров и один GPU NVIDIA L4. Kleister-NDA одновременно содержит более длинные и менее структурированные документы, поэтому эксперимент не отделяет влияние длины от влияния разметки. Результат показывает различие между двумя типами документов, но не доказывает, что одна лишь сложность расположения всегда меняет победителя.
Энергию нормировали на страницу и измеряли в установившемся режиме, без загрузки модели. Основная метрика считала долю полей, где набор значений совпал полностью, но не штрафовала модель за поля, которые она оставила без ответа. Перед внедрением выводы стоит перепроверить на собственных документах, учитывая и пропуски, и холодный запуск сервиса.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



