Журнал · Rit.work

PCQC оценивает вопросы, которых медицинский агент не задал

PCQC сравнивает альтернативные вопросы по их пользе для диагноза и обучает медицинского агента даже на тех вариантах, которые не попали в диалог.

Rit.work
Студия разработки
24 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Медицинскую диалоговую модель научили получать обучающий сигнал не только за итоговый диагноз, но и за альтернативные вопросы, которые не попали в разговор. PCQC обошла GRPO и ATPO на каждом тестовом наборе и потребовала меньше вопросов к пациенту. Метод меняет обучение агентов, которые по ходу беседы добывают недостающие сведения; поскольку препринт не рецензирован, все числа получили сами авторы.

Как неотправленному вопросу назначают ценность

Обычное обучение с подкреплением оценивает консультацию по конечному результату: модель получает награду, если поставила правильный диагноз. Такой сигнал не показывает, какой вопрос помог, какой оказался лишним и что случилось бы после другого вопроса.

Полные сведения о клиническом случае доступны во время обучения, хотя сама модель видит только уже состоявшуюся часть разговора. PCQC использует эту разницу: на одном и том же состоянии диалога модель предлагает несколько следующих действий, из которых извлекают вопросы-кандидаты.

Замороженная модель пациента отвечает на каждый кандидат по полной карточке случая. Один вопрос действительно продолжает консультацию, а остальные остаются альтернативными ветками: система получает возможный ответ, но не разыгрывает весь последующий диалог.

Затем замороженный диагностический оценщик рассматривает каждую пару «вопрос — ответ» вместе с предыдущим разговором. Ценность кандидата равна вероятности, которую оценщик присвоил правильному диагнозу после появления новых сведений.

PCQC сравнивает кандидатов только внутри одного состояния диалога. Вопросы с ценностью выше среднего получают положительный вес, ниже среднего — отрицательный. Общая исходная информация у них совпадает, поэтому разница указывает на пользу конкретного вопроса, а не на сложность пациента или уже собранный анамнез.

Этот сигнал применяется к токенам выполненных и невыполненных вопросов. Ответы модели пациента нужны только как контекст и сами не обучаются. Параллельно GRPO продолжает вознаграждать правильный итоговый диагноз, поэтому одна часть функции потерь учит добывать сведения, а другая — использовать их в конце консультации.

Невыбранные ветки улучшили и точность, и длину диалога

Средняя точность PCQC составила 63,10%. Она превысила результат GRPO на 4,38 процентного пункта, а ATPO — на 4,21 процентного пункта. Преимущество сохранилось на MedQA, MedicalExam, MedMCQA и iCRAFT-MD.

По сравнению с GRPO модель задавала на 33,1% меньше уточняющих вопросов. Это важно для самой постановки задачи: метод не улучшил диагноз ценой более длинного опроса, а научил раньше выбирать сведения, которые сильнее меняют диагностическую картину.

Контрольный эксперимент отделил пользу альтернативных веток от обычной оценки выполненного вопроса. Когда диагностический оценщик обучал только на реально заданных вопросах, результат уже превосходил обучение по одному конечному диагнозу. Добавление прямого сигнала для невыбранных кандидатов подняло среднюю точность ещё на 5,36 процентного пункта.

Причинный эффект отдельного вопроса этот опыт не доказывает: ценность определяет другая языковая модель. Однако дополнительная проверка показала, что вопросы с высокой оценкой чаще приводили к правильному диагнозу при продолжении разговора. Значит, оценщик улавливал не только собственную уверенность сразу после ответа, но и полезность сведений для дальнейшей консультации.

Планы меняются в обучающем контуре, а не в рабочем API

PCQC подходит не любому диалоговому агенту. Для обучения нужны полная скрытая карточка случая, правильный итоговый ответ и модель пациента, способная правдоподобно отвечать на альтернативные вопросы. Такой набор естественен для симуляторов, синтетических сценариев и журналов процессов с известным конечным состоянием.

Если эти данные уже есть, команде стоит добавить генерацию кандидатов и их сравнительную оценку до длинных прогонов по каждой ветке. Метод извлекает обучающий сигнал из короткой пары «вопрос — ответ» и не требует продолжать все альтернативные разговоры до диагноза. При этом обучающий контур становится сложнее: кроме основной модели в нём работают отдельные модели пациента и диагностического оценщика.

Рабочий контур не меняется. После обучения агенту не нужны ни полная карточка пациента, ни альтернативные ответы, ни диагностический оценщик: он выбирает следующий вопрос по наблюдаемому разговору. Поэтому PCQC влияет прежде всего на подготовку модели, а не на задержку и состав компонентов при использовании.

Эксперименты проводили с Qwen3-8B в ролях врача и пациента, а для оценки диагностической пользы использовали Qwen3-14B. Сравнение охватывает симулированные консультации с готовыми вариантами ответа и тем же протоколом для Shared SFT, GRPO, ATPO и PCQC. Работа измеряет точность диагноза и длину опроса на тестовых наборах, а не клиническую безопасность при общении с реальными пациентами.

За пределами медицины схема применима к агентам, которые последовательно запрашивают данные перед решением: поддержке, диагностике оборудования или сбору требований. Но перенос требует аналога полной карточки случая и проверяемого правильного исхода. Без них ответить на неотправленный вопрос и объективно оценить его пользу не получится.

Источники

Иллюстрация: рисунок из статьи «PCQC: Privileged Counterfactual Question Credit for Multi-Turn Medical Dialogue», Chenxuan Li, Jiayi Wan, Xinrong Chen и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу