Журнал · Rit.work

ChestPheNoT извлекает факты из рентгенологических отчётов без внешнего API

ChestPheNoT показывает, как обучить компактную локальную модель извлекать клинические факты вместе с цитатами из исходного отчёта.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель ChestPheNoT научили извлекать из рентгенологических отчётов находку, её статус и дословный подтверждающий фрагмент. В нерецензированном препринте команды University of Minnesota и University of California Davis все числа получены самими авторами: версия на 3 млрд параметров обошла более крупную модель с обучением по одному примеру и почти сравнялась с моделью на 72 млрд параметров. Такой подход позволяет обрабатывать закрытые клинические тексты внутри инфраструктуры учреждения и проверять каждый результат по первоисточнику.

Разметку собрали из двух учителей

ChestPheNoT построена на Qwen2.5-Instruct и возвращает массив JSON. В каждой записи есть название находки, статус «присутствует», «отсутствует» или «неясен», а также одна или несколько дословных цитат из отчёта.

Для обучения использовали 22 тысячи отчётов MIMIC-CXR без ручной разметки. CheXbert определял находки и их статусы, а локально запущенная Qwen2.5-72B подбирала подтверждающие фрагменты. В обучающий набор попадали только цитаты, которые дословно встречались в исходном документе.

Такую разметку называют серебряной: её создают другие модели, а не специалисты. Она дешевле экспертной, но наследует ошибки учителей. В данном случае ChestPheNoT прежде всего учится воспроизводить решения CheXbert и связывать их с подходящими предложениями отчёта.

Сначала модель полностью дообучили на собранных примерах. Затем применили GRPO: модель получала награду за совпадение находки и статуса с целевым ответом, а также за корректную структуру JSON. Качество подтверждающих цитат в награду не входило, поэтому его измеряли отдельно.

Во время работы модель формирует пять вариантов ответа. Находка остаётся в результате, если появилась хотя бы в трёх вариантах; подтверждающие предложения объединяются и сверяются с исходным текстом. Если цитату сопоставить не удаётся, запись не скрывают, а помечают как непроверяемую.

Компактная модель лучше переносит смену учреждения

На отчётах MIMIC-CXR из исходного распределения ChestPheNoT уступила своему учителю CheXbert на 3,9 пункта F1. На данных NIH из другого учреждения она, напротив, обошла CheXbert на 2,0 пункта, причём разница статистически значима. Это не означает общего превосходства: результат зависит от учреждения, набора терминов и правил объединения находок.

Более 99% итоговых подтверждающих фрагментов удалось найти в исходном отчёте. Однако совпадение текста ещё не доказывает, что цитата действительно подтверждает вывод. Поэтому авторы ввели аудируемый F1: запись засчитывается, только если модель верно определила статус, привела существующий фрагмент и модель-оценщик признала его релевантным. F1 здесь объединяет точность и полноту в одну метрику.

По аудируемому F1 ChestPheNoT получила 47,5 против 39,9 у Qwen2.5-7B с обучением по одному примеру. Результат также оказался близок к Qwen2.5-72B, хотя ChestPheNoT значительно меньше и не требует такой модели при обычном запуске.

Слабее всего система работает со статусом «неясен». Она часто цитирует слова о стабильности состояния, тогда как модель-оценщик не считает такую формулировку достаточным признаком неопределённости. При этом разметка NIH относит связанные со стабильностью формулировки именно к этому статусу. Часть ошибки поэтому отражает конфликт правил оценки, а не только поведение ChestPheNoT.

Проверка охватывала отчёты MIMIC-CXR и NIH: внутри исходного распределения, при смене таксономии и при переходе в другое учреждение. Релевантность цитат оценивали только на обезличенных данных NIH и одной LLM, которой не показывали полный отчёт. Такая проверка служит приближением и не заменяет заключение рентгенолога.

Что меняется в плане разработки

Работа предлагает не готовую клиническую систему, а воспроизводимую архитектуру для закрытого контура. Большая модель нужна на этапе подготовки разметки, но рабочая версия остаётся компактной: веса ChestPheNoT-3B занимают примерно 6 ГБ и укладываются в бюджет одной GPU с 24 ГБ памяти.

Главный практический вывод — специализированное дообучение может быть выгоднее, чем передача отчёта крупной универсальной модели вместе с примером ответа. Это особенно существенно, если текст нельзя отправлять во внешний API, а оператор должен видеть основание для каждой записи.

Основу рецепта составляют фиксированная схема результата, два раздельных учителя и строгая проверка цитат по исходному документу. GRPO остаётся дополнительным этапом: он почти не помог на знакомом распределении, а выигрыш проявился главным образом при переносе. Для первой версии продукта разумнее сначала проверить качество серебряной разметки и обычного дообучения.

Планы внедрения всё равно должны включать локальную проверочную выборку. Если будущие отчёты похожи на MIMIC-CXR, CheXbert остаётся точнее по находкам и статусам. Если важны перенос между учреждениями и проверяемые цитаты, ChestPheNoT показывает более подходящую конструкцию, но правила для неопределённых случаев придётся согласовать с врачами до запуска.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу