Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Robin Linzmayer и Noémie Elhadad из Columbia University исследовали, как вводящий в заблуждение контекст искажает ответы медицинских LLM; работа опубликована как препринт, не проходивший рецензирования. По их замерам, модель-монитор обнаруживала 78% искажённых решений по полной цепочке рассуждений против максимум 32% по итоговому ответу при 5% ложных срабатываний. Результат важен для команд, которые выбирают модели и проектируют контроль медицинских систем на базе ИИ.
Что сделали
Авторы взяли медицинские вопросы с вариантами ответа из MedMisBench и добавляли к ним один из двух ложных сигналов. Первый представлял собой вымышленное клиническое свидетельство в пользу неправильного варианта, второй — голословное утверждение, что этот вариант верен. На одинаковых вопросах проверили DeepSeek-R1-Distill-Qwen-14B, gpt-oss-120b и GPT-5.4.
Голословное утверждение склоняло модели к указанному ответу на 10–27 процентных пунктов чаще, чем вымышленное свидетельство. Анализ цепочек рассуждений показал разные механизмы: ложное свидетельство учитывалось на ранних этапах и постепенно влияло на вывод, а прямое указание чаще перенаправляло уже почти завершённое рассуждение. При этом именно второй сигнал реже упоминался в видимом ответе.
Для проверки авторы использовали отдельную LLM как модель-монитор. Она читала либо полную цепочку рассуждений, либо только ответ и определяла, повлиял ли внедрённый сигнал на решение. Доступ к цепочке оказался полезнее, особенно когда монитору заранее описывали признаки такого влияния.
Что это значит
Если контроль медицинской системы строится только поверх ответа API, он может не увидеть внешний сигнал, изменивший вывод модели. Доступ к полной цепочке рассуждений становится архитектурным свойством: открытая модель позволяет добавить отдельный контроль, тогда как закрытый API может оставить только итоговый текст. Однако сама цепочка не гарантирует обнаружения — результат зависит от модели-монитора и инструкции для неё.
Ограничения. Основной эксперимент проведён на 8 627 искусственно модифицированных вопросах с вариантами ответа, а механизм искажения изучался лишь на 40 цепочках одной небольшой модели. Сигнал всегда добавляли одной фразой в фиксированной позиции, поэтому работа не показывает, сохранится ли эффект в медицинских записях и диалогах. Авторы также не сравнивали разные обученные мониторы и схемы доступа, а скрытая цепочка GPT-5.4 не позволила проверить её напрямую.
Источники
Иллюстрация: рисунок из статьи «Untangling the Mechanisms of Misleading Context in Medical Question Answering», Robin Linzmayer, No\'emie Elhadad, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



