Журнал · Rit.work

Модель-оценщик требует четырёх раздельных реестров

Смешение синтетических ошибок, ответов модели и человеческих правок создаёт правдоподобные числа, которые нельзя называть показателями модели-оценщика.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

В аудите биомедицинской системы доля подтверждённых синтетических ошибок превратилась в «точность» модели-оценщика — долю верных срабатываний, хотя независимые ответы модели для расчёта не сохранились. Sidi Chang и Peiying Zhu показали, что результат 71% описывает проверенные заготовки, а не качество модели; препринт не рецензирован, а все числа получили сами авторы. Командам придётся хранить происхождение тестовой ошибки, ответ модели и решение эксперта раздельно, иначе привычная формула посчитает не ту величину.

Для этого нужны четыре реестра. Первый содержит ошибки, намеренно внесённые при подготовке теста. Второй записывает, что самостоятельно нашла модель; третий связывает каждое предложение с решением эксперта, а четвёртый хранит ошибки, которые эксперт добавил сам. Название таблицы или поля не заменяет источник записи: импортированная тестовая метка не становится ответом модели, даже если код называет её результатом проверки.

Смешение реестров дало ещё и «полноту» 21,8% — долю всех ошибок, которую якобы обнаружила модель. На деле это доля подтверждённых заготовок среди карточек итоговой проверки: эксперты добавили ещё 79 замечаний. Эти добавления нельзя считать пропусками модели, потому что её независимый список ответов отсутствовал, а эксперты не работали по протоколу полного поиска пропущенных ошибок.

Аудит охватывал один частный процесс: японские устные отчёты о передаче ухода преобразовывали в структурированные медицинские записи. Итоговую проверку прошли 22 из 47 подготовленных примеров, повторная разметка встречалась редко, поэтому работа показывает сам механизм ошибки, но не оценивает его распространённость. Чтобы сообщать точность и полноту модели-оценщика, системе нужно сохранять её версию и исходный ответ, скрывать тестовые метки во время запуска, отдельно проверять каждое срабатывание и применять зафиксированное правило сопоставления.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу