Журнал · Rit.work

Как раздельно обучать очередь реплик и смысл голосового агента

Авторы предлагают брать динамику разговора из записей человеческих диалогов, а содержание ответов — из текстовых данных, разделяя эти сигналы функцией потерь SAC.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Yihang Li и Chenhui Chu из Kyoto University предложили способ раздельно обучать управление репликами и содержание ответов полнодуплексного голосового агента; работа опубликована как препринт, не проходивший рецензирования. На Full-Duplex-Bench их система превзошла каждый из трёх выбранных базовых вариантов как минимум по 7 из 12 показателей. Работа важна командам, которые хотят добавить перебивания и короткие подтверждения в голосовой интерфейс, не заменяя текстовую LLM сквозной речевой моделью.

Что сделали

Полнодуплексный диалог позволяет агенту слушать и говорить одновременно. Это нужно, чтобы реагировать на перебивание, не принимать короткое «угу» за попытку забрать очередь и вовремя продолжать речь после паузы.

Авторы строят решение на Neural Finite State Machine, или NFSM. В этой схеме обычная LLM генерирует на одной последовательной «ленте» как текст ответа, так и управляющие токены: продолжать говорить, продолжать слушать либо переключить состояние. Дополнительный контроллер или отдельная классификационная головка модели не требуются.

Проблема исходного подхода NFSM — обучение по синтетическим текстовым диалогам. Такая выборка должна одновременно передать смысл разговора и его временную динамику, хотя в обычном тексте нет точных пауз, наложений речи и ошибок потокового распознавания.

Li и Chu разделили источники обучающего сигнала. Реальные разговоры человек — человек отвечают за смену очереди, паузы и перебивания. Текстовые диалоги человек — агент задают содержание и стиль ответов. Благодаря этому от одного набора данных не требуется достоверно воспроизводить обе составляющие.

Для речевых корпусов Fisher и Switchboard авторы сначала выделяют реплики и паузы, а затем классифицируют участки разговора по семи типам событий: продолжение, смена говорящего, пауза, промежуток между репликами, короткая обратная связь, успешное и неуспешное перебивание. Детерминированные правила превращают события в управляющие токены NFSM. Разметка этой части не требует аннотаций, созданных LLM.

Каналы обрабатываются несимметрично. Реплики условного пользователя проходят через тот же модуль распознавания речи, который будет работать в готовой системе, поэтому обучение видит его задержки и ошибки. Для канала агента берётся исходная расшифровка, чтобы модель не училась воспроизводить ошибки распознавания в собственных ответах.

Текстовые диалоги человек — агент фильтруются, переписываются LLM в разговорный стиль и преобразуются в ту же ленту состояний. Здесь смена очереди простая, поэтому эти данные прежде всего обучают содержанию.

Для совместного обучения предложена функция потерь Source-Aware Calibrated Loss, или SAC. Она корректирует перекос между частыми токенами продолжения и редкими токенами переключения, а также меняет вес сигнала в зависимости от источника: речевые диалоги сильнее влияют на управление очередью, текстовые — на ответы.

Что показали

Авторы обучали систему на базе Qwen3-4B и проверяли два варианта потокового распознавания: Faster-Whisper с выделением реплик по паузам и более дробный SimulStreaming. Основными проверками стали качество управления очередью, VoiceBench для содержания ответов и независимый от схемы управляющих токенов Full-Duplex-Bench.

При одинаковом объёме обучающих токенов сочетание реальных речевых и текстовых диалогов оказалось лучше воспроизведённого авторами синтетического варианта NFSM. Добавление SAC повышало качество распознавания редких переключений состояния, не создавая заметного ухудшения семантических результатов.

После масштабирования смеси повторной выборкой данных результат на VoiceBench отставал от исходной Qwen3-4B на 0,09 балла. На Full-Duplex-Bench система опередила Moshi по 10 из 12 показателей, Freeze-Omni — по 8 из 12, Gemini Live — по 7 из 12. При этом обработка пауз осталась слабым местом: модель чаще конкурентов преждевременно забирала очередь.

Ограничения

Последовательная текстовая лента сжимает два параллельных аудиоканала в дискретный порядок токенов и неизбежно теряет часть временной информации. Она также не представляет интонацию, эмоции и особенности голоса; выразительность ограничена внешним синтезатором речи. Авторы не проводили пользовательское исследование воспринимаемой естественности.

Проверка охватывает диалоги двух участников и роль ассистента, отвечающего на вопросы. Речевая часть построена на Fisher и Switchboard, семантическая — на корпусе диалогов человек — агент; эксперименты включают вариант с одинаковым бюджетом токенов и масштабирование повторной выборкой. Многопользовательские разговоры и другие роли агента не исследованы.

Содержание канала агента в речевых корпусах принадлежит обычным участникам разговора и может не соответствовать стилю ассистента. Кроме того, публичной реализации исходного NFSM не было, поэтому авторы воспроизвели базовый вариант самостоятельно. Сравнение с NFSM не отделяет эффект данных от возможных различий реализации, а сравнение с внешними системами на Full-Duplex-Bench не изолирует только предложенный способ обучения.

Что это значит

Для команд, строящих голосового агента вокруг текстовой LLM, работа меняет план подготовки данных. Вместо одного синтетического корпуса имеет смысл отдельно собирать временную структуру реальных разговоров и диалоги с нужным содержанием. Архитектуру базовой модели при этом можно оставить прежней, добавив управляющие токены и правила преобразования данных.

Практическая сложность переносится в конвейер данных. Потребуются точные временные метки, потоковое распознавание, классификация перебиваний и проверка допустимых переходов автомата. SAC имеет смысл, если редкие переключения действительно теряются среди частых продолжений; это следует измерять на собственных сценариях звонков или голосового интерфейса.

Для продуктов, где важны эмоции, выразительная речь, несколько собеседников или обучение непосредственно по звуку, работа не заменяет сквозную речевую архитектуру. Её результат стоит воспринимать как основание для прототипа модульного агента, а не как подтверждение готовности метода к производственной эксплуатации.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу