Журнал · Rit.work

Медицинские исследования LLM не успевают за сменой моделей

Анализ 11 628 публикаций показал: строгие медицинские исследования часто оценивают LLM, которые уже сменились новыми версиями или перестали развиваться.

Rit.work
Студия разработки
11 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Медицинские исследования LLM всё хуже успевают за моделями, которые оценивают. Карту публикаций составили Raad Bin Tareaf, Murad Al-Rajab и Samia Loucif: средняя задержка между выпуском модели и выходом работы выросла более чем вчетверо, хотя препринт не рецензирован и числа получили сами авторы. Строгая клиническая проверка поэтому всё чаще описывает не ту систему, которую команда собирается внедрять.

Работа охватывает 11 628 записей PubMed в четырнадцати клинических областях с начала 2023-го до середины 2026-го. Задержку считали от выпуска самого нового семейства моделей, названного в заголовке или аннотации, до публикации исследования. Карту построили по метаданным и фиксированным правилам классификации, без применения генеративных моделей.

Переход исследователей на новые системы компенсировал лишь 56% естественного устаревания литературы. Разрыв сохранился и после исключения ранних моделей вроде BERT и GPT-3, поэтому его нельзя объяснить только накоплением старых публикаций.

Главное различие связано не столько со сроком исследования, сколько с выбором модели. Среди рандомизированных исследований 62% проверяли семейство, которое разработчик уже перестал обновлять. Если оставить только активно развиваемые семейства, статистически значимая разница между рандомизированными исследованиями, препринтами и обзорами исчезает.

Это карта медицинской литературы, а не сравнение качества моделей или результатов лечения. Для выбора системы одной ссылки на клиническое исследование недостаточно: нужно сверить семейство, точную версию и дату доступа с текущим внедрением. Собственную проверку стоит строить так, чтобы закрепить актуальную модель при регистрации протокола или заменить её без переделки всего исследования.

Источники

Иллюстрация: рисунок из статьи «The widening evaluation gap in medical large language model research 2023 to 2026», Raad Bin Tareaf, Murad Al-Rajab, Samia Loucif, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу