Журнал · Rit.work

Подмена ECG выявила, что клинические модели игнорируют изображения

Подмена ECG другого пациента показала, что высокая точность мультимодальной модели ещё не доказывает, что она использует изображение при прогнозе.

Rit.work
Студия разработки
21 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Мультимодальные клинические модели могут хорошо предсказывать исход, почти не используя электрокардиограмму (ECG) конкретного пациента. В препринте, который не прошёл рецензирование и содержит замеры самих авторов, правильная ECG не давала четырём моделям устойчивого преимущества над чужой ECG или одним медицинским текстом. Для оценки таких систем одной итоговой метрики недостаточно: входные данные нужно подменять по одному.

Проверка сохраняла историю болезни, вопрос и правильный ответ, но меняла изображение. Модель получала ECG нужного пациента, запись другого пациента с противоположным исходом либо только текст. Так авторы разделили два сбоя: модель полностью игнорирует изображение или реагирует на наличие любой кардиограммы, не различая пациентов.

Чтобы исправить этот сбой, авторы заморозили Qwen3.5-4B и обучили несколько векторов-подсказок, которые влияют на ответ только через представление изображения. Сначала модель училась предсказывать исход по правильным парам истории болезни и ECG, затем — отдавать предпочтение правильному ответу с ECG того же пациента, а не с подменённой записью.

После такого обучения сбалансированная точность — средняя полнота по классам — достигла 70,6% для госпитализации в интенсивную терапию и 67,5% для ухудшения состояния. Разрыв между правильной и подменённой ECG составил соответственно 16,5 и 5,5 процентного пункта. LoRA давала более высокую итоговую точность, но почти одинаковый результат при правильных и чужих ECG: улучшение могло идти за счёт текста, а не изображения.

Проверку провели на MDS-ED для двух задач: госпитализация в интенсивную терапию и ухудшение состояния. Прогноз строили по данным первых 90 минут, а ухудшение отслеживали в течение 24 часов. Без дополнительного обучения сравнили Qwen3.5-4B, Qwen3.8-27B, Gemma4-4B и MedGemma1.5-4B; предложенный способ адаптации проверяли на Qwen3.5-4B. Для продукта вывод практический: мультимодальную модель стоит тестировать не только без одного источника данных, но и с правдоподобной подменой этого источника.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу