Журнал · Rit.work

MedNotes превращает структурированные медкарты в проверенные клинические заметки

Разбираем, как MedNotes генерирует клинические заметки, проверяет факты и структуру, исправляет ошибки и отбрасывает ненадёжные результаты.

Rit.work
Студия разработки
22 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Из структурированных электронных медкарт научились получать синтетические клинические заметки с автоматическим контролем качества. В работе Optum AI и UnitedHealth Group итоговую проверку прошли 91,4% заметок, хотя препринт не рецензирован и все числа получили сами авторы. Для команд, которые готовят медицинские данные для обучения моделей, MedNotes предлагает замену одиночному запросу: черновик проходит несколько независимых проверок, исправляется или отбрасывается.

Как черновик проходит через генератор и проверяющих

MedNotes получает сведения о текущем приёме и короткую историю предыдущих визитов. Диагнозы, лекарства, процедуры, лабораторные результаты и показатели жизненно важных функций заранее переводят из медицинских кодов в понятные модели описания.

Генератор GPT-4.1 собирает из этих данных заметку в формате SOAP. Он разделяет текст на субъективные сведения, объективные данные, оценку состояния и план. Такой формат нужен не для имитации документа врача, а для единообразного представления данных, которое можно проверять по секциям.

С субъективной частью система работает консервативно. Если в структурированной карте нет слов пациента, жалоб или подробностей осмотра, генератор должен пропустить их, а не достраивать правдоподобный рассказ.

После генерации специализированные агенты проверяют четыре свойства. Первый сопоставляет утверждения с исходной картой, второй ищет пропущенные медицинские сущности, третий оценивает согласованность секций, четвёртый отмечает неподтверждённые утверждения и определяет их опасность.

Агрегатор превращает найденные ошибки в инструкции для следующей версии. Одновременно он сохраняет правильные фрагменты как опорные, чтобы при переписывании модель не испортила уже подтверждённый текст. Маршрутизатор принимает заметку, возвращает её генератору или отбрасывает после не более чем трёх раундов.

Проходной порог составил 0,95 для фактической точности, 90% для полноты и 0,67 для соответствия структуре. Критических галлюцинаций должно быть ноль. Условия применяются одновременно: высокий средний балл не компенсирует опасное неподтверждённое назначение или диагноз.

Повторная проверка возвращает большинство неудачных черновиков

Конвейер проверили на 1485 приёмах из EHRSHOT — обезличенного набора продольных структурированных медкарт. В него входят пациенты с диабетом, гипертонией и ожирением, а также общая группа. Источником служили коды и измерения, а не разговоры с пациентами или готовые заметки врачей.

После первого черновика проверку проходили 69,4% приёмов; следующие раунды довели показатель до итогового уровня из лида. Лучше всего исправлялись отдельные фактические ошибки и галлюцинации. Устойчивые пропуски сущностей и нарушения структуры чаще сохранялись до конца, после чего система не выпускала заметку.

Принятые тексты использовали в двух последующих задачах: предсказании кодов процедур CPT и определении секции для каждого абзаца. В обоих случаях синтетические заметки дополняли небольшой набор реальных, а не заменяли его. Для классификации секций макро-F1 вырос с 0,752 до 0,972; этот показатель усредняет качество по всем классам, не позволяя частому классу скрыть ошибки на редких.

Предварительный просмотр врачом охватил лишь небольшую часть заметок и был качественным, а не формальным исследованием. Тексты оставались читаемыми и привязанными к источнику, но наследовали его бедность: в них не появлялись клинические рассуждения, результаты осмотра и рассказ пациента, если таких сведений не было в карте.

Конвейер меняет архитектуру подготовки данных, но не заменяет медицинскую проверку

Работа влияет на планы команд, которым нужно превратить структурированные медкарты в текстовый корпус. Вместо одного запроса к модели потребуется отдельный контур контроля: проверяющие с разными задачами, правила совместного допуска, адресная обратная связь и отказ от результата после исчерпания попыток.

Такой подход делает ошибку управляемой. Неподтверждённый фрагмент не просто снижает общий балл, а возвращается генератору с указанием секции и причины. Опорные фрагменты уменьшают риск, что очередная правка сломает корректную часть заметки.

В расчёт инфраструктуры придётся включать весь цикл, а не только первый вызов GPT-4.1: повторная генерация и несколько проверяющих агентов увеличивают задержку и расход API. Взамен команда получает явную точку отказа и может хранить причины, по которым конкретную заметку не приняли.

MedNotes стоит рассматривать как способ построить промежуточное представление для обучения и тестирования моделей. Проход автоматических порогов означает соответствие структурированному источнику, но не подтверждает пригодность текста для лечения или полноценной документации врача. Результаты последующих задач также поддерживают смешанный сценарий: синтетические данные усиливают небольшой реальный набор, а не доказывают, что без реальных заметок можно обойтись.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу