Журнал · Rit.work

TrialAtlas проверяет дизайн клинических испытаний по прецедентам FDA

TrialAtlas разделяет анализ клинического испытания между специализированными агентами, сверяет выводы с регуляторными прецедентами и предлагает проверяемые правки протокола.

Rit.work
Студия разработки
21 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систему для планирования клинических испытаний научили не только прогнозировать решение регулятора, но и находить слабые места протокола с предложениями по их исправлению. Хотя работа не рецензирована и числа в ней получили сами авторы, TrialAtlas обошёл сильнейшую сопоставимую систему на 6,1 пункта при поиске недостатков дизайна. Результат показывает, что в регулируемых задачах общий контур поиска полезно разделять по видам доказательств и снабжать памятью о прошлых решениях.

Агенты разделяют источники, а не дублируют друг друга

TrialAtlas устроен как исследовательская организация. Директор разбирает запрос на задачи, передаёт их специализированным отделам и собирает итоговый вывод. Руководители отделов координируют рабочих агентов, которые ищут данные, сопоставляют документы и возвращают структурированные результаты.

Каждый отдел отвечает за свой класс доказательств. Анализ конкурирующих испытаний работает с ClinicalTrials.gov, синтез научных данных — с PubMed и PubTator, а проверка лекарственных и регуляторных прецедентов — с OpenFDA, Drugs@FDA и маркировками препаратов. Агенты могут выполнять код в изолированной среде, когда нужно объединить промежуточные результаты.

Общая память хранит повторяющиеся недостатки дизайна, регуляторные сигналы риска и способы рассуждения, которые помогали в прошлых случаях. Каждая запись включает описание ситуации, пример и объяснение позиции регулятора. Память пополняют на этапе адаптации по историческим испытаниям и письмам FDA, а затем передают агентам вместе с новым заданием.

Такое устройство меняет роль модели. Она не выставляет протоколу один непрозрачный балл, а показывает, какие конечные точки, группы сравнения или меры против систематической ошибки вызвали сомнения и на какие материалы опирается вывод. Эксперт может проверить цепочку доказательств до того, как рекомендация попадёт в рабочий документ.

Проверка охватила недостатки, правки и вероятность одобрения

Для TrialAtlasBench связали 291 письмо FDA об отказе одобрить заявку в текущем виде с записями соответствующих испытаний в ClinicalTrials.gov. Отдельную проверочную часть составили 150 испытаний, которые не использовали при создании памяти. Поиск внешних материалов также ограничили источниками, предшествующими проверочному периоду.

В задаче поиска недостатков TrialAtlas получил F1 50,0%. Эта метрика сводит точность и полноту в одну оценку и снижается, если система либо пропускает проблемы, либо отмечает слишком много ложных. Результат оставляет большой запас для улучшения: примерно половина эталонных замечаний остаётся ненайденной, а часть выданных предупреждений не совпадает с замечаниями FDA.

При выборе подходящих изменений протокола F1 достиг 69,4%, что на 12,8 пункта выше ближайшего результата. Система должна была отличать применимые правки от технически правдоподобных, но неуместных советов — например, изменений, которые усложняют испытание или мешают интерпретировать конечную точку.

В прогнозе регуляторного исхода сбалансированная точность составила 85,3%. Она отдельно считает качество для одобренных и неодобренных заявок, поэтому перевес одного класса меньше искажает результат. TrialAtlas при этом выдавал не калиброванную вероятность успеха, а один из двух вариантов исхода.

Сравнение контролировало влияние базовой модели: TrialAtlas, прямой вызов LLM, ReAct, Biomni и TrialGenie работали на GPT-5. Поэтому разница отражает прежде всего организацию поиска, специализацию агентов и регуляторную память, а не переход на другую модель.

Контур подходит для предварительной проверки, но не для автономного решения

Работа поддерживает практический шаблон для команд, которые строят системы анализа регулируемых документов. Вместо одного универсального агента можно разделить источники по предметным областям, хранить проверяемую память о прецедентах и требовать от каждого вывода ссылку на доказательство. Смена базовой LLM тогда не затрагивает весь процесс целиком.

В слепой оценке отраслевые эксперты признали обоснованными 86,4% замечаний TrialAtlas против 83,1% у OpenAI DeepResearch. Эти доли нельзя напрямую сопоставлять с F1 на основном тесте: эксперты оценивали только те замечания, которые каждая система решила выдать, а не полный фиксированный набор возможных недостатков.

Границы проверки не позволяют переносить результат на полноценную экспертизу протокола без пилота. Система получала структурированные записи из публичного реестра, а не полные протоколы; задачи поиска недостатков и правок были оформлены как выбор вариантов, причём рекомендации и отвлекающие ответы помогали формировать другие модели. Реальная работа с внутренними документами, свободной формой ответа и правилами конкретной организации может дать другой результат.

Поэтому TrialAtlas разумно рассматривать как средство предварительного отбора: он собирает возможные риски, объясняет их и передаёт специалисту. План внедрения стоит менять на уровне архитектуры и проверки гипотезы, но не на уровне ответственности: окончательное решение по дизайну испытания остаётся у клинических, статистических и регуляторных экспертов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу