Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Noora Health перестроила систему экстренного триажа медицинских сообщений так, чтобы причину каждой тревоги можно было проверить по шагам. По данным препринта, который не прошёл рецензирование и в котором числа получены самими авторами, полнота — доля найденных реальных экстренных случаев — выросла с 0,565 до 0,810. Для продуктовой команды это переносит клиническую политику из LLM в компонент, который специалисты могут читать и менять сами.
Модель понимает сообщение, но не принимает клиническое решение
Первоначальная система получала сообщение пациента, список опасных признаков и просила LLM сразу определить экстренность. Вместе с ответом модель генерировала цепочку рассуждений, но она не делала решение по-настоящему прозрачным: чтобы найти причину ошибки, специалистам приходилось разбирать отдельный текст для каждого сообщения.
Такой подход смешивал две задачи. Модель одновременно переводила бытовое описание в медицинские понятия и решала, требует ли ситуация срочной очной помощи. Изменение подсказки могло затронуть обе части, поэтому перед выпуском исправления команде приходилось заново проверять всю систему.
В TRACE эти задачи разделены. Gemini-2.5-Flash сначала переводит сообщения, написанные на разных языках и часто латиницей. Затем LLM извлекает нормализованные симптомы и контекст пациента: категорию помощи, срок беременности, возраст младенца и другие сведения, от которых зависит срочность.
Финальный ответ выдаёт детерминированный движок: одинаковый набор симптомов и контекста всегда приводит к одному результату. Клинические специалисты задают отдельные правила для самостоятельных опасных признаков и для сочетаний. Например, один симптом может требовать срочной помощи только вместе с другим симптомом или на определённом этапе беременности.
Ошибка теперь относится к конкретному слою. Система могла неверно перевести сообщение, пропустить симптом, ошибиться в контексте или не найти подходящего правила. Первые случаи разбирает команда машинного обучения, а словарь и правила исправляют клиницисты.
Основной прирост дали структурированные правила
Системы сравнивали на 427 ранее не использованных сообщениях из WhatsApp на семи языках. Запросы размечали штатные клиницисты с доступом к тому же контексту пациента, который получала система. Метрики отражают внутренний протокол Noora Health для материнской и неонатальной помощи, поэтому переносить их на другой медицинский процесс без собственной проверки нельзя.
F1 вырос с 0,606 до 0,702. Эта метрика объединяет полноту и долю верных тревог среди всех поднятых: она падает как при пропущенных экстренных случаях, так и при избытке ложных срабатываний.
Сравнение промежуточных вариантов показало, что главный вклад внесла не сама двухступенчатая схема, а формализованная клиническая политика. Когда структурированные правила передавали непосредственно LLM, результат был близок к TRACE. Дополнительное извлечение контекста также не дало измеримого прироста качества, хотя сохранило контекст в журнале решения и упростило проверку правил.
За аудируемость пришлось заплатить: TRACE обходился в 1,5 раза дороже варианта, где LLM сама применяла те же правила. В расчёт не входил перевод, общий для всех сравниваемых систем. Поэтому работа подтверждает пользу разделения прежде всего для эксплуатации, а не как универсальный способ сократить расходы или повысить метрики.
Командам стоит сначала вынести политику из модели
Схема меняет планы продуктов, где решение опирается на явную предметную политику, а ошибку должен разбирать специалист. В таких системах LLM разумно оставить языковым интерфейсом: она приводит свободный текст к ограниченному набору сущностей, а проверяемый компонент принимает решение.
Начинать стоит не с новой модели, а с описания процесса эксперта. Нужно зафиксировать словарь, сочетания признаков, зависимость от контекста и владельца каждого типа ошибки. Если эти знания остаются внутри подсказки или весов модели, любое исправление снова потребует участия разработчиков и полной проверки поведения.
После запуска TRACE обработала 152 421 запрос пациента. Медсёстры отметили как избыточные 17,8% тревог и не зафиксировали роста числа пропущенных экстренных случаев. Клиницисты самостоятельно добавили 48 правил, не меняя подсказку LLM — именно такой короткий цикл исправлений и оправдывает более сложный конвейер.
Эти результаты пока относятся к системе поддержки решений: тревоги проверяют медсёстры и врачи, а модель не отвечает пациентам напрямую. Работа оценивает качество классификации и эксплуатационный процесс, но не связывает новую архитектуру с долгосрочными исходами для пациентов. Для автономного медицинского продукта приведённых проверок недостаточно.
Источники
Иллюстрация: рисунок из статьи «Auditable Emergency Triage for Maternal and Newborn Care in India», Shobhit Jagga, Aman Dalmia, Niharika Priyadarshini и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



