Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Правильный диагноз медицинской LLM часто оказывается удачной догадкой: модель отвечает раньше, чем наблюдения позволяют исключить альтернативы. В препринте Zhejiang University, Ant Healthcare и Ant Group, который не прошёл рецензирование и в котором все числа получили сами авторы, предложенная EVD-Harness повысила точность максимум на 51,1 процентного пункта. Для команд, которые строят последовательных агентов, результат предлагает архитектурное правило: генератор может предполагать ответ, но разрешать его отправку должен отдельный контур.
Как отделили знание от удачной догадки
Обычная проверка учитывает только финальный диагноз. Если модель назвала болезнь правильно по первому симптому, она получает ту же оценку, что и модель, которая дождалась подтверждающего анализа. Такая метрика не различает обоснованный вывод и везение.
В MedEVM каждый случай представлен как последовательность коротких наблюдений. После очередного шага модель выбирает: ждать следующую порцию данных или необратимо отправить диагноз. Для случая отмечена граница достаточности — первый шаг, на котором накопленные сведения позволяют отличить верный диагноз от девяти правдоподобных альтернатив.
Ответ до границы считается преждевременным, даже если диагноз совпал с эталоном. Неверный ответ после границы — уже ошибка диагностики, а продолжение ожидания показывает, что модель не смогла вовремя воспользоваться достаточными данными. Так MedEVM разделяет качество медицинского вывода и решение о моменте отправки.
Дополнительная проверка запускается на копии текущего контекста и получает распределение вероятностей по вариантам диагноза. Она не меняет исходную траекторию, но показывает, знала ли модель правильный ответ, когда решила ждать или отвечать. Границу включали в набор только при единогласии трёх моделей-разметчиков; часть примеров дополнительно проверяли специалисты с медицинской подготовкой.
MedEVM содержит 1050 опубликованных клинических случаев из 24 групп заболеваний. На нём сравнили девять LLM, но условия остаются контролируемыми: варианты ответа заданы заранее, а наблюдения приходят по фиксированному расписанию. Поэтому работа хорошо проверяет момент отправки диагноза, но не воспроизводит обычную распространённость болезней, свободный поиск диагноза и активные вопросы пациенту.
Почему уверенность не управляет моментом ответа
Размер и способность рассуждать не устранили преждевременные ответы. Qwen3-8B отправляла диагноз слишком рано в 99,1% случаев, а включение режима рассуждения подняло этот показатель до 94,1–99,7% у проверенных моделей. Дополнительные рассуждения здесь чаще закрепляли раннюю гипотезу, чем заставляли ждать подтверждения.
Проблема не сводится к нехватке медицинских знаний. На границе достаточности средняя вероятность правильного диагноза составляла 0,70–0,86: модель часто уже выделяла верный вариант, но её решение отвечать не следовало за этой оценкой. Значит, уверенность в ответе и достаточность оснований нельзя считать одной величиной.
Порядок поступления данных тоже влиял на действие. Перестановка одинаковых наблюдений до границы меняла итог в 29,0–52,9% случаев, хотя к самой границе распределения вероятностей оставались близкими. Добавленные ложные сведения могли перенаправить диагноз и после того, как правильный вариант уже получил достаточную поддержку.
Это не только особенность метрики. Когда специальный шлюз запрещал преждевременный ответ и заставлял дождаться размеченной границы, точность на исходно преждевременных траекториях выросла на 29,6–48,4 процентного пункта. Такой шлюз использует эталонную разметку и не годится для реальной системы, но эксперимент показывает причинную связь между ранней отправкой и ошибками.
EVD-Harness меняет не модель, а контур управления
EVD-Harness заменяет недоступный эталонный шлюз проверкой оснований. Система отделяет создание диагностической гипотезы от разрешения показать её как итоговый ответ. Внутри она использует Contrastive Diagnostic Wiki — заранее собранный справочник, который описывает не только признаки болезней, но и различия между похожими диагнозами.
- Управление наблюдениями. Контур сохраняет поступившие сведения как общую историю и извлекает из справочника знания, относящиеся к текущим кандидатам. Новая порция данных не должна вытеснять уже полученные основания.
- Предложение и независимая проверка. Одна часть системы формирует возможные диагнозы, другая ищет в истории наблюдения, которые их подтверждают или опровергают. Проверяется не уверенность модели сама по себе, а связь гипотезы с конкретными данными случая.
- Контроль отправки. Перед ответом система валидирует приведённые основания. Если подтверждение не выдерживает проверки, диагноз остаётся рабочей гипотезой, а агент продолжает ждать данные.
Удаление справочника или независимой проверки снижало точность, а полный вариант показал лучший результат у всех проверенных моделей. Это говорит в пользу составного контура: одного поиска медицинских знаний недостаточно, если та же модель свободно решает, когда её гипотеза стала ответом.
Работа меняет планы команд, которые проектируют агентов для медицины и других процессов с поэтапным поступлением сведений. Вместо замены базовой LLM на более крупную имеет смысл заложить журнал неизменяемых наблюдений, отдельную проверку ссылок на них и шлюз отправки. Метрику также стоит разделить: считать не только верные ответы, но и преждевременные решения, задержки после достаточных данных и устойчивость к перестановке фактов.
Переносить заявленный прирост прямо в клинический продукт нельзя: его получили на опубликованных случаях с фиксированными кандидатами. Практический результат работы уже применим как инженерная гипотеза — право отправить решение не должно принадлежать тому же компоненту, который это решение предложил.
Источники
Иллюстрация: рисунок из статьи «Can LLMs Value the Right Evidence? Evidence-Value Misalignment in Dynamic Medical Diagnosis», Kehua Feng, Yunsheng Lu, Yitong Qiao и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



