Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из Stanford University, UCLA, Emory University и Mayo Clinic разработали VERDICT — систему сопоставления пациентов с клиническими испытаниями; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, система точнее протестированных решений на основе LLM и нейросимвольных методов. Работа важна командам, которым нужно не только получить ответ модели, но и проверить применённую политику, допущения и основания для пересмотра решения.
Что сделали
VERDICT разделяет понимание текста и принятие решения. LLM разбирает условия клинического испытания, медицинскую запись и правила обработки недостающих сведений, но не определяет итоговую пригодность пациента напрямую.
Условия испытания переводятся в задачу выполнимости формул в теориях — SMT. Каждое требование становится типизированным ограничением: например, диагнозом, приёмом препарата, лабораторным значением или временным интервалом. Для ограничения сохраняется ссылка на исходный фрагмент текста.
Затем LLM извлекает относящиеся к каждому условию сведения о пациенте. Значение помечается как наблюдаемое, восстановленное по заданной политике или неизвестное. Это образует отдельный журнал допущений: система позволяет отличить факт из записи от значения, принятого из-за отсутствия данных.
SMT-решатель проверяет совместимость сведений о пациенте с требованиями испытания. Если ограничения совместимы, пациент признаётся подходящим; если нет — неподходящим. Решение получается из формулы, а не генерируется языковой моделью.
Дополнительный решатель MaxSMT ищет минимальный набор условий, который потребуется изменить для противоположного результата. Для неподходящего пациента это препятствия, устранение которых может сделать его подходящим. Для подходящего — условия, нарушение которых изменит решение. После вычислений LLM переводит формальный вывод, допущения и ключевые условия в текст для врача.
Что показали
Авторы проверили VERDICT на двух наборах: 552 парах «пациент — испытание» из выборки на основе SIGIR 2016 и 363 парах из TREC 2021. Систему сравнивали с решениями, которые принимают решение непосредственно через LLM, а также с нейросимвольными подходами.
В работе утверждается, что VERDICT занял первое место по точности решения среди протестированных вариантов. Формальная часть показала 100% согласованность применения политики: одинаковое представление условий приводит к одному и тому же логическому результату.
Авторы также измеряли самосогласованность объяснения с решением. Если система называет условие ключевым, его изменение должно менять итог. Для формального представления VERDICT это свойство обеспечивается конструкцией алгоритма: ключевые условия вычисляет MaxSMT, а не формулирует LLM после получения ответа.
Врачебная оценка, по утверждению авторов, чаще отдавала предпочтение обоснованиям VERDICT. В них отдельно показывались подтверждающие сведения, принятые допущения и условия пересмотра.
Ограничения
Гарантии VERDICT относятся к формальному представлению, а не к исходному тексту. LLM может неверно разобрать критерий испытания, извлечь факт из медицинской записи или применить правило обработки пропуска. SMT-решатель затем безошибочно обработает неверно составленную формулу, поэтому проверяемая логика не устраняет ошибки на входе.
Оценка проведена на двух ретроспективных наборах для одной задачи — подбора клинических испытаний. Для выборки на основе SIGIR метки пригодности формировала группа моделей GPT-5 с последующей проверкой части примеров врачом; сами записи не отражают всей сложности реальных электронных медицинских карт. Работа не показывает результаты перспективного внедрения на потоке пациентов, влияние на клинические исходы или устойчивость ошибок для отдельных групп.
В приведённых материалах нет количественного отрыва VERDICT от каждого конкурента, а также сравнения стоимости, задержки и трудоёмкости подготовки формальных политик. Поэтому заявленное лидерство по точности нельзя перенести на эксплуатационные расходы или скорость разработки.
Что это значит
Работа не меняет планы команд, которым нужен вероятностный совет, черновик или поиск по тексту: добавление формального решателя усложнит систему без обязательной пользы. VERDICT предназначен для решений, которые требуется оспаривать, повторно запускать после изменения фактов и проверять на одинаковое применение правил.
Для таких продуктов архитектурный вывод существенен: LLM стоит рассматривать как переводчик неструктурированного текста в проверяемое представление, а не как окончательный механизм решения. Политика должна существовать отдельно от подсказки модели, факты — иметь ссылки на источники, пропуски — фиксироваться явно, а итог — вычисляться детерминированным компонентом.
Это не готовая замена существующего контура. Команде потребуется определить типы ограничений, правила разрешения неизвестных значений, порядок проверки извлечённых фактов и интерфейс исправления формулы человеком. Если решение нельзя выразить через достаточно стабильные ограничения, преимущество SMT уменьшается.
Практический ориентир — переносить в формальный слой только ту часть процесса, где правила действительно должны исполняться одинаково. LLM можно оставить разбор документов и подготовку понятного текста, но решение, журнал допущений и условия его изменения должны строиться из одной проверяемой модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



