Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Медицинского агента научились проверять не только по заключению, но и по каждому переходу от симптомов к выводу. Хотя работу Guangzhou University и Chinese Academy of Sciences не рецензировали и все числа получили сами авторы, MedTraj довёл долю правильных ответов на задаче CECMed до 73,8% и сократил долю выдуманных утверждений на 87% относительно базового запроса без примеров. Для продукта это переносит контроль качества с финального ответа на всю цепочку, по которой агент к нему пришёл.
Как рассуждение превращают в проверяемую траекторию
MedTraj представляет ответ как структурированную траекторию: клинические наблюдения, медицинские свидетельства, пронумерованные шаги рассуждения и итоговое заключение. Такая схема позволяет отдельно проверить, заметила ли модель важный симптом, чем подкрепила переход и следует ли вывод из предыдущих шагов.
Траекторию оценивает другая LLM. Она проверяет связность шагов, опору на медицинские свидетельства, полноту, прослеживаемость вывода и долю выдуманных утверждений. Отдельно модель сопоставляет заключение с эталонным ответом и оценивает, насколько каждый шаг относится к конкретному случаю.
Эти оценки объединяются в показатель качества траектории. Выдуманное медицинское утверждение получает самый большой штраф, а логически связная цепочка — самый большой положительный вес. Поэтому правильный ответ не компенсирует путь, который опирается на неподтверждённый факт.
Чтобы отличить случайную корреляцию от конкретной причины ошибки, авторы намеренно портят корректные цепочки. Они переставляют шаги, вставляют рассуждение из другого вопроса, искажают числа, удаляют ключевое наблюдение или добавляют ошибочный фрагмент в начало либо конец. Затем модель повторно оценивает ту же траекторию, поэтому изменение показателя можно связать с внесённым дефектом.
Вклад отдельного шага измеряют похожим способом: сравнивают качество цепочки до и после его добавления. Шаг может направить рассуждение к верному ответу, поддержать уже выбранное направление или ухудшить результат. Так фильтр отделяет содержательные переходы от правдоподобного текста, который не помогает поставить диагноз.
Перестановка шагов опаснее локальной неточности
Нарушение структуры снизило качество траекторий на 27–51%, тогда как искажение числа или удаление отдельного наблюдения — на 4–7%. Значит, медицинский агент чувствителен не только к фактам, но и к порядку, в котором связывает их с заключением. Ошибка в конце цепочки вредила сильнее, чем аналогичная вставка в начале.
Основной вклад распределился неравномерно: ключевыми оказались 15,3% шагов. Остальные чаще поддерживали уже достигнутое качество или тянули оценку вниз. Для отбора обучающих примеров поэтому полезнее найти несколько определяющих переходов, чем считать всю длинную цепочку одинаково ценной.
До четвёртого шага качество оставалось стабильным, а дальнейшее удлинение чаще добавляло шум и выдуманные утверждения. Это даёт практическое правило для генерации: ограничивать длину, проверять вклад очередного перехода и обрезать продолжение, если оно не улучшает траекторию.
Контекст с оценёнными примерами повысил связность рассуждения на 0,029–0,041 по сравнению с запросом без примеров. MedTraj помещает в запрос как хорошие, так и плохие траектории вместе с оценками, чтобы модель различала полезные и вредные образцы прямо во время генерации ответа. Для этого не нужно обновлять веса модели.
Что меняется в планах медицинских команд
Работа предлагает промежуточный слой контроля между генерацией и выдачей результата. Команда может хранить наблюдения, свидетельства, шаги и заключение раздельно, а затем отклонять ответ, если один из ключевых переходов не опирается на данные случая. Проверка только совпадения с эталоном такого дефекта не найдёт.
Контролируемые ошибки дают способ собирать отрицательные примеры без ручного написания каждой неудачной цепочки. Из проверенного рассуждения можно получить варианты с нарушенным порядком, чужим фрагментом или потерянным наблюдением, повторно оценить их и использовать при выборе примеров для запроса. Это подходит для прототипа, где дообучение модели пока слишком дорого или усложняет выпуск.
Метод проверяли на CareQA с открытыми медицинскими вопросами, PubMedQA с ответами по биомедицинским публикациям и CECMed с оценкой тяжести состояния пожилых пациентов. Траектории генерировала Qwen3-32B, а оценивала Qwen3-8B. Одна модельная семья одновременно создаёт материал и контролирует его, поэтому внутренне связная медицинская выдумка может пройти фильтр.
Эта граница не отменяет инженерный результат, но определяет следующий шаг: прежде чем использовать показатель качества как барьер в клиническом процессе, его нужно сопоставить с оценками врачей на целевых сценариях. Сейчас MedTraj меняет планы прежде всего для стендов и внутренних помощников: вместо наращивания длины рассуждения стоит вкладываться в структуру, проверку отдельных переходов и выбор примеров по качеству.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



