Журнал · Rit.work

Синтетические данные для Thai OCR: что переносится на реальные документы

Авторы проверили, какие свойства синтетических документов помогают распознавать реальный тайский текст и когда такая адаптация может заменить сбор постраничной разметки.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Kunat Pipatanakul представил Wayu-Paxa-OCR-Zero — модель распознавания тайских документов, обученную без OCR-меток с реальных тайских страниц, в препринте, который не проходил рецензирования. На рукописных страницах медианная доля ошибочных символов снизилась с 74,87% у базовой модели до 20,55% после адаптации. Работа важна командам, которым не хватает размеченных документов для языка или предметной области, но доступны шрифты, образцы письма и исходные макеты.

Что сделали

Авторы построили управляемый конвейер реконструкции документов. Исходный текст удаляли со страницы, а затем помещали в те же области тайский текст с известной разметкой. Для англоязычных источников текст в основном переводили на тайский; геометрию областей, порядок чтения и элементы страницы сохраняли.

Конвейер позволил независимо менять свойства синтетики, которые обычно смешиваются под словом «реалистичность»:

  • оставлять фон, таблицы, линии и иллюстрации либо заменять их белым полем;
  • использовать набор тайских шрифтов либо один шрифт;
  • сохранять двумерное расположение блоков либо складывать их в линейную последовательность;
  • рисовать рукописный текст шрифтом либо собирать его из реальных образцов отдельных знаков;
  • брать структуру тайских документов либо реконструировать англоязычные страницы.

Эти варианты проверяли отдельно для обучения на целых страницах и на вырезанных текстовых областях. Различие принципиально: постраничная модель видит взаимное расположение элементов, а двухэтапная система сначала получает области от детектора и распознаёт каждую отдельно.

Из результатов авторы собрали рецепт для Wayu-Paxa-OCR-Zero. Модель с 0,9 млрд параметров адаптировали на 45 723 синтетических страницах. Исходными макетами служили публичные англоязычные документы; OCR-метки с реальных тайских страниц в обучение итоговой модели не входили.

Что показали

По замерам авторов, фон и нетекстовые элементы не давали устойчивого выигрыша. Перенос на реальные документы сильнее зависел от разнообразия шрифтов, сохранения двумерной структуры и вариативности рукописных знаков. Особенно заметно качество ухудшалось на почерке, когда все символы получали одинаковые шрифтовые очертания.

Для обучения на целых страницах реконструкция тайских документов приблизилась к обучению на реальных печатных страницах: медианная доля ошибочных символов составила 1,82% против 1,31%. Метрика считает удаления, вставки и замены символов; меньшее значение означает более точное распознавание.

При обучении на отдельных областях результат развернулся: синтетика на структуре тайских документов дала 15,59% ошибки, а реконструкция документов из другой предметной области — 5,52%. Авторы не установили причину этого эффекта. Практический вывод состоит в том, что соответствие исходного домена само по себе не гарантирует лучшего переноса: результат зависит от того, какую часть страницы получает модель.

Удаление нетекстового окружения меняло медианную ошибку не более чем на 1,62 процентного пункта в проведённых сравнениях и не давало последовательного улучшения. Поэтому точное воспроизведение фона, печатей или графики выглядит менее приоритетным, чем типографика и пространственная организация текста.

Ограничения

Работа рассматривает тайский язык и не показывает, сохранится ли результат для других систем письма. Управляемые эксперименты проводились на реальных печатных страницах и фотографиях учебных тетрадей; итоговую модель дополнительно проверяли на ThaiOCRBench и SEA-DocBench. Это не покрывает все виды сканов, исторические документы, редкие шрифты и почерки, которые могут встретиться в прикладной системе.

«Обучение только на синтетике» здесь не означает отсутствие реальных тайских материалов во всём конвейере. Авторы использовали профиль шрифтов, измеренный по публичным тайским PDF, и банк реальных рукописных знаков. Исключены именно постраничные OCR-метки реальных документов, а не любые сведения о языке и его визуальном представлении.

Сравнение с другими OCR-системами не изолирует влияние синтетических данных: модели различаются архитектурой, предварительным обучением, размером и источниками разметки. Работа также не сопоставляет задержку, требования к памяти и стоимость эксплуатации. Наконец, синтетическое обучение всё ещё уступает реальной разметке на тяжёлых ошибках и рукописном тексте, а причина зависимости от масштаба обучения остаётся неясной.

Что это значит

Для команд, чей план упирается в дорогую постраничную разметку, работа меняет порядок вложений. До запуска массовой ручной разметки имеет смысл проверить реконструкцию существующих макетов: сохранять геометрию областей, собирать разнообразные шрифты и добавлять вариативные образцы рукописных знаков. Тратить основную часть усилий на точное воспроизведение фона по этим замерам не требуется.

Архитектуру конвейера нужно выбирать до генерации датасета. Синтетика, подходящая модели целой страницы, может оказаться неудачной для системы «детектор плюс распознаватель». Поэтому набор следует оценивать в том же режиме, который будет работать в продукте, а не только на отдельной исследовательской модели.

Работа не обосновывает полный отказ от реальных проверочных данных. Для печатных документов синтетическая адаптация уже выглядит рабочим способом начать разработку без большого корпуса меток. Для рукописного текста и неизвестных типов документов она скорее сокращает объём начальной разметки, чем отменяет сбор целевого набора для приёмочного тестирования.

Источники

Иллюстрация: рисунок из статьи «How Far Can Synthetic Data Take Thai OCR?», Kunat Pipatanakul, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу