Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Команда Jina AI by Elastic представила Jina-OCR-v1, модель для сквозного разбора документов; это препринт, не проходивший рецензирования. По замерам авторов, механизм FastMTP почти удвоил скорость декодирования на NVIDIA L4 без изменения результата базового жадного декодирования. Работа важна командам, которые локально извлекают из документов текст, формулы и таблицы и ограничены доступными GPU.
Что сделали
Jina-OCR-v1 построена на архитектуре DeepSeek-OCR. Визуальный кодировщик сжимает страницу в сравнительно короткую последовательность признаков, а декодер на смеси экспертов активирует около 570 млн параметров для каждого токена. Такое устройство уменьшает вычисления на двух этапах: модель обрабатывает меньше визуальных признаков и использует только часть декодера.
Авторы добавили FastMTP — механизм спекулятивного декодирования. Обычная генеративная модель выпускает токены последовательно. FastMTP одним общим блоком заранее предлагает несколько следующих токенов, после чего основной декодер проверяет их параллельно. Совпавшие варианты принимаются, а первое несовпадение заменяется результатом основного декодера.
Проверка жадная: принимается только тот токен, который самостоятельно выбрал бы основной декодер. Поэтому авторы называют декодирование без потерь, но речь идёт не о безошибочном распознавании документа. Механизм лишь сохраняет ту же последовательность, которую модель получила бы без FastMTP.
Вторая часть работы относится к дообучению. Авторы использовали плотные проверяемые награды: формулы, таблицы, структуру Markdown, повторы и формат результата оценивает детерминированный код относительно эталона. Частично правильный документ получает частичный балл, поэтому сигнал обучения не сводится к ответу «верно» или «неверно». Для увеличения доли страниц, где такие проверки применимы, в обучающую смесь добавили синтетические документы с формулами и сложными таблицами.
Дообучение также включало следование инструкциям и работу с повреждёнными документами: архивными сканами, газетами, формами и страницами с шумом или геометрическими искажениями. Целевой результат — не только текст, но и машинно-читаемая структура документа.
Что показали
Качество авторы проверяли на двух наборах. На olmOCR-Bench, где используются проверки наличия текста, порядка чтения, математики и таблиц, модель получила 83,4. На OmniDocBench v1.6, объединяющем оценки текста, формул и таблиц, результат составил 91,14. В первом сравнении Jina-OCR-v1 уступила chandra-ocr-2 и dots.mocr, а во втором — PaddleOCR-VL-1.6 и HunyuanOCR-1.5.
В общем тесте производительности авторы измерили 2,57 страницы в секунду — лучший результат среди включённых ими систем. Однако скорость страницы зависела не только от вычислений: Jina-OCR-v1 генерировала более короткие ответы, поэтому завершала документы быстрее моделей с высокой скоростью выпуска отдельных токенов.
На NVIDIA L4 FastMTP ускорил обычное выполнение в 1,95 раза. При использовании CUDA graphs, которые сами сокращают накладные расходы основного декодера, преимущество спекулятивного режима снизилось до 1,17 раза. Это показывает, что эффект зависит от программного режима: чем дешевле один обычный шаг декодирования, тем сложнее окупить подготовку и проверку дополнительных вариантов.
Ограничения
Качество проверяли на двух публичных наборах, а общий замер пропускной способности — на 1 403 страницах olmOCR-Bench. Последний выполнялся на одном A100 с параллельностью 32, тогда как FastMTP отдельно измеряли на L4 с пакетным размером один. Эти результаты нельзя напрямую переносить на интерактивную задержку, другие GPU, длинные очереди или документы конкретной компании.
Сравнение производительности не охватывает большинство конвейеров, где разметка страницы и распознавание выполняются отдельными моделями. Работа также не показывает стоимость обработки страницы, потребление памяти и выигрыш всего производственного конвейера с загрузкой файлов, предварительной обработкой и проверкой результата. Все основные замеры провели сами авторы модели; независимого воспроизведения в источнике нет.
Что это значит
Работа не требует менять планы команд, которые уже получают приемлемое качество от облачного API или двухэтапного конвейера. Она не доказывает, что единая генеративная модель будет дешевле с учётом инфраструктуры, контроля ошибок и повторной обработки. Разница в качестве с лидерами сравнений также не позволяет выбирать Jina-OCR-v1 только по скорости.
Планы могут измениться у команд, которым нужен локальный разбор больших потоков документов на GPU класса L4. Для них работа предлагает совместимую инженерную связку: сжатое визуальное представление уменьшает вход, смесь экспертов ограничивает объём вычислений декодера, FastMTP сокращает число последовательных шагов, а проверяемые награды улучшают специализированные структуры без отдельной модели-оценщика.
Практический следующий шаг — прототип на собственных документах, а не немедленная замена системы. В нём следует раздельно измерить точность текста, формул и таблиц, длину ответа, задержку страницы и долю результатов, требующих повторной обработки. Особенно важно проверить FastMTP в выбранном режиме выполнения: приведённые авторами замеры показывают, что оптимизация базового декодера способна заметно уменьшить дополнительный выигрыш.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



