Журнал · Rit.work

Как превратить вероятности модели в бюджет ручной проверки

Jev извлекает из полицейских описаний фиксированные признаки, а калибровка вероятностей позволяет рассчитать объём ручной проверки до запуска системы.

Rit.work
Студия разработки
22 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Из полицейских описаний ДТП научились массово извлекать признаки, которых не хватает в обычных полях базы. В работе Amir Rafe и Subasish Das добавление таких признаков выявило ещё 10 747 аварий с травмами или погибшими в год, не учтённых в стандартной классификации.

Хотя препринт не рецензировали и все числа получили сами авторы, он описывает полезную для производственных систем связку: закрытая схема ответов, проверка вероятностей и заранее рассчитанная очередь для специалиста.

Фиксированные ответы заменяют генерацию текста

Jev не пишет объяснение и не собирает JSON свободной формы. Аналитик заранее задаёт вопросы, допустимые варианты и зависимости между ними, а модель выбирает вариант и возвращает его вероятность. Например, положительный ответ о неисправности автомобиля открывает уточняющий вопрос о её типе.

Такой интерфейс убирает несколько классов ошибок. Модель не может придумать новое значение, пропустить обязательное поле или ответить не на тот вопрос. Результат не нужно очищать и разбирать перед загрузкой в базу, но правильность выбранного варианта всё равно приходится проверять.

Схема разделяет обнаружение события и его детали. Сначала модель решает, упомянут ли фактор вообще, затем отвечает только на относящиеся к нему вопросы. Имена и категории она выбирает из закрытого набора, поэтому каждый результат сохраняет заранее известный тип.

Полную схему из 27 вопросов применили к 195 857 описаниям из Texas Crash Records Information System. Обработка стоила 0,154 доллара на тысячу текстов, а перенос той же ставки на весь доступный корпус дал оценку в 774 доллара. Расход сильнее зависел от размера схемы, чем от длины описания: главный способ сэкономить здесь — убрать лишние вопросы или объединить их в один вызов.

Калибровка превращает уверенность в очередь для аналитика

Вероятность полезна только после калибровки. Если модель одинаково уверенно помечает группу записей, заявленная уверенность должна совпадать с долей верных ответов в этой группе. Без такой проверки число нельзя использовать ни как оценку распространённости события, ни как основание для автоматического принятия решения.

Одного сравнения с полями государственной базы оказалось недостаточно. Эти поля сами пропускают сведения, которые инспектор записал в свободном тексте, поэтому низкое согласие не всегда означает ошибку модели. Для отдельной проверки собрали 2 416 согласованных человеческих оценок: специалисты отвечали, что именно сказано в описании, а не пытались восстановить реальное развитие аварии.

На этой разметке Jev получил F1 0,908. Метрика F1 объединяет точность положительных ответов и полноту, то есть способность находить нужные случаи без большого числа ложных срабатываний. Высокое качество классификации не сделало исходные вероятности надёжными: модель систематически оценивала некоторые события выше их фактической частоты.

Повторная настройка вероятностей сократила ошибку калибровки в 3,3 раза. Чтобы результат не зависел от запоминания тех же примеров, преобразование обучали на одной части разметки, а проверяли на другой. После этого для целевой точности 90% системе требовалось отправлять человеку 0,8% помеченных записей; бюджет считали именно среди срабатываний, а не среди всего массива, где редкие события легко скрываются за большинством отрицательных примеров.

Командам нужен аудит модели, а не ставка на её класс

Работа меняет план внедрения систем, которые превращают документы в поля базы. Начинать стоит не с запроса «извлеки всё в JSON», а со схемы решений: определить допустимые значения, условия появления уточняющих вопросов и цену ошибки для каждого признака. Такой контракт проще версионировать, тестировать и подключать к рабочему процессу.

Следующий обязательный слой — независимая разметка на собственных документах. Сравнение Jev с генеративными моделями передового уровня показало, что качество вероятностей зависит от конкретной модели, а не от того, генерирует ли она текст. Замена архитектуры поэтому не отменяет калибровку и не позволяет переносить пороги из чужого исследования.

Практический результат аудита — таблица порогов и объём работы специалистов по каждому полю. Редкий, но критичный признак может требовать просмотра большей доли срабатываний, чем частая и однозначная категория. После обновления модели тот же набор примеров нужно прогнать снова: Jev закрыт, его обучающие данные не описаны, а поведение версии может измениться.

Проверка охватывает полицейские описания из одного штата и один коммерческий сервис. Человеческий эталон включает случаи, по которым разметчики смогли согласиться, а стоимость конкурирующих генеративных моделей в работе не измеряли. Поэтому переносить готовые пороги в медицину, страхование или другой регион нельзя, но сам порядок действий переносится: закрытая схема, локальный эталон, калибровка и бюджет проверки до производственного запуска.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу