Журнал · Rit.work

StreamAlign выравнивает речь с токенами LLM в потоке

StreamAlign разбивает потоковую речь на согласованные с LLM единицы, не дожидаясь конца реплики и не сводя акустические признаки к целым словам.

Rit.work
Студия разработки
10 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Речь научились разбивать на согласованные с LLM единицы до того, как говорящий закончит реплику. Команда Seoul National University, University of California, Berkeley, KRAFTON и Georgia Institute of Technology представила StreamAlign; хотя препринт не рецензирован и все числа в нём получили сами авторы, в их опыте средняя задержка от входного фрагмента до восстановленной речи сократилась с 560 до 270 мс. Такой токенизатор позволяет строить голосовую модель поверх текстовой LLM без обязательного ожидания полной записи.

Как речь привязали к подсловам LLM

Текстово-согласованная токенизация сжимает речь так, чтобы каждой текстовой единице LLM соответствовал акустический токен. Последовательность остаётся примерно такой же длины, как обычный текст, тогда как традиционные речевые кодеки выдают намного больше единиц на ту же реплику.

Предыдущие методы сначала распознавали запись целиком. Кроме задержки, здесь возникал словарный рассинхрон: система распознавания речи и LLM по-разному делили слово на части. Поэтому акустические признаки часто объединяли на уровне целого слова, а затем копировали для нескольких подслов LLM. Модель теряла различия в произношении отдельных частей слова.

StreamAlign принимает речь фрагментами. Потоковая система автоматического распознавания речи предлагает слова, а трансдьюсерная сеть RNN-T сопоставляет звуковые кадры с символами этих слов. После этого токенизатор LLM делит результат на подслова, и блок на архитектуре Transformer собирает для каждого подслова соответствующие акустические признаки.

Символы служат промежуточным слоем между двумя словарями. Они не зависят от того, как конкретная LLM делит текст, но позволяют сохранить более точные акустические границы, чем выравнивание по целым словам. Итоговая единица содержит подслово, коды его звучания и длительность.

Обратное преобразование также идёт потоком. Первый декодер разворачивает подсловные единицы в последовательность речевых признаков, а потоковый вокодер превращает их в звуковую волну. Оба компонента обрабатывают уже завершённые подслова и не ждут конца высказывания.

Границу слова модель определяет заранее

На краю входного фрагмента слово может уже закончиться или продолжиться в следующем фрагменте. Без дополнительного механизма токенизатор должен каждый раз ждать продолжения, даже если слово завершено. Это и создавало большую часть устранимой задержки.

StreamAlign использует небольшой классификатор границы слова. Он анализирует внутреннее состояние RNN-T и решает, можно ли сразу зафиксировать последнее слово. Незавершённое слово переносится в следующий фрагмент, а завершённое немедленно поступает в токенизатор LLM и декодер.

На LibriSpeech test-clean доля неверно распознанных слов после восстановления речи составила 4,41%. Это лучший результат среди включённых в сравнение потоковых, непотоковых и текстово-согласованных токенизаторов. Автоматическая оценка естественности UTMOS достигла 4,23 и также оказалась самой высокой в таблице.

Выравнивание по символам оказалось не только способом уменьшить задержку. При прямом обучении на подсловах Llama качество разрушалось: медианное подслово встречалось в обучающих данных лишь 31 раз, тогда как каждый символ — более 22 000 раз. Замена внимательного объединения кадров простым усреднением тоже заметно ухудшила распознаваемость восстановленной речи.

StreamAlign-SLM, речевая модель поверх этих единиц, показала лучшую общую согласованность на SALMon и spoken StoryCloze и обошла сравниваемые модели в человеческой оценке продолжения речи. Здесь проверяли не только разбор слов, но и сохранение голоса, интонации и смысловой связи продолжения с исходным фрагментом.

Архитектура меняет прототип, но не снимает зависимость от ASR

Для команды, которая соединяет речь с готовой текстовой LLM, работа предлагает практичную замену двум неудобным вариантам: длинной последовательности обычных акустических токенов и офлайн-распознаванию перед токенизацией. StreamAlign сохраняет длину текстовой последовательности и допускает постепенную генерацию ответа. Это может изменить архитектуру голосового агента, синхронного перевода или речевого интерфейса, где конец реплики заранее неизвестен.

Метод не устраняет автоматическое распознавание речи. Ему по-прежнему нужна потоковая ASR, которая подсказывает слова, а её ошибки немного влияют на смысловые задачи. Акустические признаки при этом не копируют гипотезу ASR буквально: восстановленная речь в эксперименте распознавалась точнее, чем текстовая подсказка, потому что токены сохраняли дополнительную информацию из звука.

Связка со словарём LLM выглядит менее жёсткой, чем у прежних методов. Модель обучали с токенизатором Llama, а при проверке заменили его на Qwen3 без повторного обучения и получили сопоставимое качество. Для продуктовой команды это аргумент в пользу отдельного слоя речевого выравнивания, но пока не гарантия совместимости с любым токенизатором.

Проверки охватывают английскую речь. Токенизатор обучали на LibriTTS и английской части Emilia, восстановление оценивали прежде всего на LibriSpeech, а речевую модель — на SALMon, spoken StoryCloze и задаче продолжения. На спонтанных разговорах проверяли восстановление речи, но не полноценное речевое моделирование, поэтому для многоязычного продукта или диалогов с переключением языков потребуется собственная проверка.

Источники

Иллюстрация: рисунок из статьи «StreamAlign: Streaming Text-Aligned Speech Tokenization», Kang-wook Kim, Jinyoung Park, Jinsoo Kim и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу