Журнал · Rit.work

Клинические бенчмарки пропускают основную работу LLM у врачей

Реальные запросы медиков к LLM состоят прежде всего из документации и поиска сведений, тогда как публичные тесты сосредоточены на других задачах.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Клинические бенчмарки проверяют не ту работу, которую медики поручают LLM-ассистентам. В препринте, который не проходил рецензирование и где числа рассчитали сами авторы, совпадение медианного бенчмарка с распределением реальных задач составило лишь 31%. Поэтому высокий итоговый балл пока не доказывает, что система справится с документацией, локальными правилами и запросами, где сначала нужно уточнить контекст.

Работа охватила 127 833 запроса к защищённому ассистенту за восемь месяцев. Системой пользовались врачи, медсёстры и специалисты расширенной практики из 35 специальностей. Запросы классифицировали по задаче, цели, достаточности контекста и возможному вреду, а затем тем же способом разобрали 58 публичных бенчмарков.

Документация и административная работа дали 36,2% реальных запросов, поиск медицинских сведений — 28,9%, а диагностика — только 3,7%. В медианном бенчмарке запросов на подготовку документации не оказалось. Даже наборы, которые создавали для имитации клинической практики, не приблизились к реальной работе сильнее, чем тесты из отчётов разработчиков передовых моделей.

Более трети запросов нельзя было качественно обработать в исходном виде: не хватало данных пациента, правил конкретной организации или актуальных источников. При этом 13,2% запросов могли причинить серьёзный или критический вред при неверном ответе. Для такой системы нужны отдельные проверки способности запросить уточнение, обратиться к надёжному источнику и отказаться от прямого ответа, а не только тесты на знание правильного диагноза.

Данные получены в одной крупной академической медицинской системе, а автоматическую разметку сверяли с оценками клиницистов. Исследование сравнивает структуру входящих запросов, но не качество ответов конкретных моделей. Для команды продукта вывод практический: оценочную выборку стоит собирать из будущего рабочего процесса и сохранять в ней реальную долю документации, поиска сведений и запросов с недостающим контекстом.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу