Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи North South University собрали KhatianDoc — набор задач для проверки LLM на рукописных земельных реестрах Бангладеш; работа опубликована как препринт, не проходивший рецензирования. В пяти категориях вопросов, составляющих 39,3% проверочной выборки, ни одна из шести моделей не дала правильного ответа. Результат важен командам, которые планируют извлекать юридически значимые данные из сканов с нестандартной письменностью и арифметикой.
Что сделали
KhatianDoc построен на 107 реальных записях RS Khatian из одного земельного управления. Эти документы фиксируют права собственности и доли участков с помощью рукописной позиционной системы Ana-Ganda-Kora-Kranti-Til с основанием 16. Авторы вручную расшифровали поля, передали их на повторную проверку специалисту по земельному праву и обезличили сведения о владельцах, сохранив связи между упоминаниями.
Набор охватывает распознавание символов, перевод долей в десятичные числа, извлечение полей и ответы на вопросы по документу. Шесть мультимодальных LLM проверяли по единому протоколу без примеров и только по изображениям. На арифметической задаче средняя абсолютная ошибка моделей, выдавших число, составила 0,40–0,42 против 0,237 у базового алгоритма, который игнорировал вход и всегда возвращал среднее значение набора. По интерпретации авторов, модели не приближались к правильному расчёту, а выдавали значения, не связанные с исходной записью.
Что это значит
KhatianDoc разделяет две причины ошибки, которые в прикладной системе легко смешать: модель должна сначала прочитать неизвестные ей знаки, а затем выполнить расчёт и связать результат с владельцами и участками. Поэтому высокая точность на обычных формах или печатных юридических текстах сама по себе не подтверждает пригодность модели для такого документооборота. Авторы также обнаружили ошибки в собственных метриках: исправили учёт отказов и обозначили показатель извлечения метаданных как завышенную верхнюю границу.
Ограничения. Все документы относятся к одному населённому пункту и одному типу стандартизированной формы; отдельная задача распознавания содержит 95 фрагментов символов. Работа показывает только результат проверки без примеров: авторы не сравнивали дообучение, поиск по внешним данным и обработку с предварительным OCR. Сложные ответы оценивались автоматически по совпадению со строкой, поэтому юридически корректная переформулировка могла считаться ошибкой. Основные замеры сделаны на закрытых оригиналах, тогда как открытая версия изображений отредактирована и исключает часть метаданных.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



