Журнал · Rit.work

LLM оставили разбирать симптомы, а экстренный триаж передали правилам

Noora Health разделила понимание медицинских сообщений и решение об экстренности, повысив полноту триажа и передав клинические правила врачам.

Rit.work
Студия разработки
10 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Noora Health перестроила систему экстренного триажа медицинских сообщений так, чтобы причину каждой тревоги можно было проверить по шагам. По данным препринта, который не прошёл рецензирование и в котором числа получены самими авторами, полнота — доля найденных реальных экстренных случаев — выросла с 0,565 до 0,810. Для продуктовой команды это переносит клиническую политику из LLM в компонент, который специалисты могут читать и менять сами.

Модель понимает сообщение, но не принимает клиническое решение

Первоначальная система получала сообщение пациента, список опасных признаков и просила LLM сразу определить экстренность. Вместе с ответом модель генерировала цепочку рассуждений, но она не делала решение по-настоящему прозрачным: чтобы найти причину ошибки, специалистам приходилось разбирать отдельный текст для каждого сообщения.

Такой подход смешивал две задачи. Модель одновременно переводила бытовое описание в медицинские понятия и решала, требует ли ситуация срочной очной помощи. Изменение подсказки могло затронуть обе части, поэтому перед выпуском исправления команде приходилось заново проверять всю систему.

В TRACE эти задачи разделены. Gemini-2.5-Flash сначала переводит сообщения, написанные на разных языках и часто латиницей. Затем LLM извлекает нормализованные симптомы и контекст пациента: категорию помощи, срок беременности, возраст младенца и другие сведения, от которых зависит срочность.

Финальный ответ выдаёт детерминированный движок: одинаковый набор симптомов и контекста всегда приводит к одному результату. Клинические специалисты задают отдельные правила для самостоятельных опасных признаков и для сочетаний. Например, один симптом может требовать срочной помощи только вместе с другим симптомом или на определённом этапе беременности.

Ошибка теперь относится к конкретному слою. Система могла неверно перевести сообщение, пропустить симптом, ошибиться в контексте или не найти подходящего правила. Первые случаи разбирает команда машинного обучения, а словарь и правила исправляют клиницисты.

Основной прирост дали структурированные правила

Системы сравнивали на 427 ранее не использованных сообщениях из WhatsApp на семи языках. Запросы размечали штатные клиницисты с доступом к тому же контексту пациента, который получала система. Метрики отражают внутренний протокол Noora Health для материнской и неонатальной помощи, поэтому переносить их на другой медицинский процесс без собственной проверки нельзя.

F1 вырос с 0,606 до 0,702. Эта метрика объединяет полноту и долю верных тревог среди всех поднятых: она падает как при пропущенных экстренных случаях, так и при избытке ложных срабатываний.

Сравнение промежуточных вариантов показало, что главный вклад внесла не сама двухступенчатая схема, а формализованная клиническая политика. Когда структурированные правила передавали непосредственно LLM, результат был близок к TRACE. Дополнительное извлечение контекста также не дало измеримого прироста качества, хотя сохранило контекст в журнале решения и упростило проверку правил.

За аудируемость пришлось заплатить: TRACE обходился в 1,5 раза дороже варианта, где LLM сама применяла те же правила. В расчёт не входил перевод, общий для всех сравниваемых систем. Поэтому работа подтверждает пользу разделения прежде всего для эксплуатации, а не как универсальный способ сократить расходы или повысить метрики.

Командам стоит сначала вынести политику из модели

Схема меняет планы продуктов, где решение опирается на явную предметную политику, а ошибку должен разбирать специалист. В таких системах LLM разумно оставить языковым интерфейсом: она приводит свободный текст к ограниченному набору сущностей, а проверяемый компонент принимает решение.

Начинать стоит не с новой модели, а с описания процесса эксперта. Нужно зафиксировать словарь, сочетания признаков, зависимость от контекста и владельца каждого типа ошибки. Если эти знания остаются внутри подсказки или весов модели, любое исправление снова потребует участия разработчиков и полной проверки поведения.

После запуска TRACE обработала 152 421 запрос пациента. Медсёстры отметили как избыточные 17,8% тревог и не зафиксировали роста числа пропущенных экстренных случаев. Клиницисты самостоятельно добавили 48 правил, не меняя подсказку LLM — именно такой короткий цикл исправлений и оправдывает более сложный конвейер.

Эти результаты пока относятся к системе поддержки решений: тревоги проверяют медсёстры и врачи, а модель не отвечает пациентам напрямую. Работа оценивает качество классификации и эксплуатационный процесс, но не связывает новую архитектуру с долгосрочными исходами для пациентов. Для автономного медицинского продукта приведённых проверок недостаточно.

Источники

Иллюстрация: рисунок из статьи «Auditable Emergency Triage for Maternal and Newborn Care in India», Shobhit Jagga, Aman Dalmia, Niharika Priyadarshini и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу