Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Из полицейских описаний ДТП научились массово извлекать признаки, которых не хватает в обычных полях базы. В работе Amir Rafe и Subasish Das добавление таких признаков выявило ещё 10 747 аварий с травмами или погибшими в год, не учтённых в стандартной классификации.
Хотя препринт не рецензировали и все числа получили сами авторы, он описывает полезную для производственных систем связку: закрытая схема ответов, проверка вероятностей и заранее рассчитанная очередь для специалиста.
Фиксированные ответы заменяют генерацию текста
Jev не пишет объяснение и не собирает JSON свободной формы. Аналитик заранее задаёт вопросы, допустимые варианты и зависимости между ними, а модель выбирает вариант и возвращает его вероятность. Например, положительный ответ о неисправности автомобиля открывает уточняющий вопрос о её типе.
Такой интерфейс убирает несколько классов ошибок. Модель не может придумать новое значение, пропустить обязательное поле или ответить не на тот вопрос. Результат не нужно очищать и разбирать перед загрузкой в базу, но правильность выбранного варианта всё равно приходится проверять.
Схема разделяет обнаружение события и его детали. Сначала модель решает, упомянут ли фактор вообще, затем отвечает только на относящиеся к нему вопросы. Имена и категории она выбирает из закрытого набора, поэтому каждый результат сохраняет заранее известный тип.
Полную схему из 27 вопросов применили к 195 857 описаниям из Texas Crash Records Information System. Обработка стоила 0,154 доллара на тысячу текстов, а перенос той же ставки на весь доступный корпус дал оценку в 774 доллара. Расход сильнее зависел от размера схемы, чем от длины описания: главный способ сэкономить здесь — убрать лишние вопросы или объединить их в один вызов.
Калибровка превращает уверенность в очередь для аналитика
Вероятность полезна только после калибровки. Если модель одинаково уверенно помечает группу записей, заявленная уверенность должна совпадать с долей верных ответов в этой группе. Без такой проверки число нельзя использовать ни как оценку распространённости события, ни как основание для автоматического принятия решения.
Одного сравнения с полями государственной базы оказалось недостаточно. Эти поля сами пропускают сведения, которые инспектор записал в свободном тексте, поэтому низкое согласие не всегда означает ошибку модели. Для отдельной проверки собрали 2 416 согласованных человеческих оценок: специалисты отвечали, что именно сказано в описании, а не пытались восстановить реальное развитие аварии.
На этой разметке Jev получил F1 0,908. Метрика F1 объединяет точность положительных ответов и полноту, то есть способность находить нужные случаи без большого числа ложных срабатываний. Высокое качество классификации не сделало исходные вероятности надёжными: модель систематически оценивала некоторые события выше их фактической частоты.
Повторная настройка вероятностей сократила ошибку калибровки в 3,3 раза. Чтобы результат не зависел от запоминания тех же примеров, преобразование обучали на одной части разметки, а проверяли на другой. После этого для целевой точности 90% системе требовалось отправлять человеку 0,8% помеченных записей; бюджет считали именно среди срабатываний, а не среди всего массива, где редкие события легко скрываются за большинством отрицательных примеров.
Командам нужен аудит модели, а не ставка на её класс
Работа меняет план внедрения систем, которые превращают документы в поля базы. Начинать стоит не с запроса «извлеки всё в JSON», а со схемы решений: определить допустимые значения, условия появления уточняющих вопросов и цену ошибки для каждого признака. Такой контракт проще версионировать, тестировать и подключать к рабочему процессу.
Следующий обязательный слой — независимая разметка на собственных документах. Сравнение Jev с генеративными моделями передового уровня показало, что качество вероятностей зависит от конкретной модели, а не от того, генерирует ли она текст. Замена архитектуры поэтому не отменяет калибровку и не позволяет переносить пороги из чужого исследования.
Практический результат аудита — таблица порогов и объём работы специалистов по каждому полю. Редкий, но критичный признак может требовать просмотра большей доли срабатываний, чем частая и однозначная категория. После обновления модели тот же набор примеров нужно прогнать снова: Jev закрыт, его обучающие данные не описаны, а поведение версии может измениться.
Проверка охватывает полицейские описания из одного штата и один коммерческий сервис. Человеческий эталон включает случаи, по которым разметчики смогли согласиться, а стоимость конкурирующих генеративных моделей в работе не измеряли. Поэтому переносить готовые пороги в медицину, страхование или другой регион нельзя, но сам порядок действий переносится: закрытая схема, локальный эталон, калибровка и бюджет проверки до производственного запуска.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



