Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Систему расшифровки клинических интервью научили одновременно отмечать, где говорит врач, а где пациент, без отдельного этапа разделения речи. На английском наборе DiaWhisper-DPO снизила ошибку разделения на 72% относительно лучшего каскадного решения, хотя препринт не рецензирован и все числа получили сами авторы. Для подобных продуктов это повод проверять единую модель вместо цепочки из распознавания, разделения собеседников и назначения ролей.
Как сбой расшифровки превращается в учебную пару
DiaWhisper построена на Whisper-large-v3. Модель дообучают через LoRA: она выдаёт текст, временные метки и теги Doctor, Patient или Interject в одной последовательности. К кодировщику также добавляют вспомогательный классификатор, который учится определять роль для каждого фрагмента звука, но при распознавании его отбрасывают.
Первый этап использует обычное обучение на правильных расшифровках. После него модель запускают на обучающем наборе и отбирают окна, где декодирование сорвалось: например, система зациклилась и стала повторять токены. Получившийся ошибочный вывод становится отвергнутым вариантом, а эталонная расшифровка — предпочтительным.
На втором этапе применяют прямую оптимизацию предпочтений (DPO). Она повышает вероятность эталонного ответа относительно реального сбоя модели. Размечать предпочтения вручную не нужно: обе стороны пары уже существуют после первого этапа обучения.
При этом параметры первого этапа фиксируют и обучают новый адаптер LoRA. Такой подход не просто ещё раз показывает модели правильный ответ, а явно сталкивает его с конкретной траекторией, на которой декодирование сломалось. Дополнительное обучение только на эталонах работало хуже, а искусственные ошибки — перестановка ролей, обрезка или подставной ответ — давали менее стабильный результат.
Почему выросла не только точность ролей
На DAIC-WOZ модель достигла точности ролей 97,3% и ошибки разделения речи 11,9%. Первая метрика показывает долю правильно назначенных реплик, причём пропущенная реплика считается ошибкой. Вторая измеряет долю времени с пропущенной, лишней или отнесённой не тому собеседнику речью.
Основной выигрыш появился потому, что модель перестала зацикливаться и бросать часть интервью. Исходная DiaWhisper не покрывала 33,6% речи после исчерпания повторных попыток декодирования, а после обучения на сбоях доля упала до 3,2%. Поэтому улучшилась и обычная ошибка распознавания слов: система стала возвращать больше полного текста, а не только точнее подписывать уже найденные реплики.
Случайная инициализация раньше заметно меняла итог: отдельные запуски DiaWhisper расходились по качеству. После DPO разброс сократился более чем в сто раз. Отключение повторных попыток почти не повлияло на улучшенную модель, то есть результат обеспечил не механизм восстановления при выводе, а обучение против прежних сбоев.
Для сравнения использовали каскадные системы на Whisper-large-v3: отдельная модель сначала разделяла голоса, после чего эвристика назначала им роли. Такая цепочка не может исправить раннюю ошибку на следующем этапе, тогда как DiaWhisper-DPO обучает текст, время и роль совместно.
Когда команде стоит менять архитектуру
Работа предлагает практичный шаблон для систем со структурированным выводом: сначала обучить модель на эталонах, затем собрать её настоящие ошибки и превратить их в пары предпочтений. Он особенно применим там, где сбой легко обнаружить автоматически — по повторению, обрыву или нарушенной структуре ответа. Ручная разметка предпочтений для этого не требуется.
Перенос между языками выглядит обнадёживающе, но не доказывает универсальность метода. После отдельного обучения на китайском PDCH-HAMD точность ролей достигла 75,7%, а улучшение появилось во всех 78 сопоставленных проверках. При этом остаточные ошибки там приходились преимущественно на неверно назначенную роль, а не на пропущенную речь.
Границы проверки узкие: английскую часть оценивали на 29 тестовых интервью DAIC-WOZ, где обе стороны диалога синтезировали из расшифровок, поскольку исходный набор распространяет только запись участника. Китайскую часть проверяли на 26 интервью PDCH-HAMD с преобразованными для приватности голосами. Это два клинических корпуса и разговоры только между врачом и пациентом.
Команде, которая уже строит отдельную диаризацию и назначение ролей поверх Whisper, имеет смысл добавить в эксперимент единую модель и сравнить ошибки всей цепочки, а не каждого компонента отдельно. Но клиническое применение по-прежнему требует проверки человеком: неверная роль меняет смысл признаков, на которых затем может работать оценка депрессии.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



