Журнал · Rit.work

Jev проверяет радиологические отчёты дешевле трёх центов за сто пар

Jev сравнивает сгенерированный радиологический отчёт с врачебным, находит неподтверждённые и пропущенные факты и требует на 43–45% меньше входных токенов, чем схема с семью вопросами.

Rit.work
Студия разработки
24 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Фактологию сгенерированных радиологических отчётов научились проверять одним вопросом к модели на каждое утверждение. В препринте, который не проходил рецензирование, числа получили сами авторы: схема сохранила почти то же согласие с оценками врачей, что и семь вопросов, но потребовала на 43–45% меньше входных токенов. Такой оценщик подходит для массового сравнения генераторов перед проверкой врачом.

Система сначала делит отчёт на отдельные медицинские утверждения с помощью локальной Qwen3.5-9B. Затем Jev проверяет каждое утверждение сгенерированного текста по полному врачебному отчёту и относит его к одному из трёх классов: подтверждено, опровергнуто или не упомянуто. Обратная проверка показывает, какие находки из эталона генератор пропустил.

На RadEvalX ранговая корреляция Кендалла с количеством ошибок, отмеченных врачами, достигла 0,573, а на RadEvalExpert — 0,398. Этот показатель отражает, насколько одинаково оценщик и эксперты упорядочивают отчёты по числу ошибок. При одинаковом разбиении текста и способе подсчёта Jev обошёл открытую модель логического вывода из текста (NLI).

Вызовы API для ста пар отчётов стоили меньше 0,03 доллара; локальное разбиение текста в эту сумму не входит. В отдельном тесте Jev распознавал ложное отрицание, например замену «есть плевральный выпот» на «плеврального выпота нет», с площадью под ROC-кривой 0,977, где единица соответствует безошибочному разделению классов.

Проверка охватила 100 пар RadEvalX, 624 пары RadEvalExpert и набор ReXErr с искусственно внесёнными ошибками. Более сложный локальный RadMatch лучше согласовался с врачами по клинически значимым ошибкам, поэтому Jev стоит рассматривать как дешёвый фильтр и средство сравнения версий, а не как замену медицинской экспертизе. Кроме того, система сверяет текст с эталонным отчётом, а не с самим снимком: ошибка или пропуск в эталоне перейдут в оценку.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу