Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Kunat Pipatanakul и соавторы представили Wayu-Paxa-TTS-Edge — компактную модель синтеза речи (TTS) с фиксированными голосами; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, модель точнее учителя расставляет паузы, но чаще ошибается на сложных словах, именах и смешанных Thai–English фразах. Работа важна командам, которым нужен один управляемый голос на устройстве, а полноценного корпуса записей нужного диктора нет.
Что сделали
Авторы проверили схему, в которой большая модель клонирования голоса становится источником обучающих данных. OmniVoice получает образец голоса длительностью 15 секунд, синтезирует подготовленные фразы, а компактная модель Kokoro учится воспроизводить тот же голос без образца во время работы.
Тексты брали из WangchanThaiInstruct, а сложные выражения дополнительно генерировали с помощью LLM. Для английской части использовали тексты LibriTTS. До синтеза цифры и встроенные английские фрагменты преобразовывали в формы, описывающие нужное произношение. Это требовалось потому, что учитель мог читать цифры по-китайски, а английские вставки — не с тем акцентом, который ожидался в тайской речи.
Каждую сгенерированную запись пропускали через фильтр. Система распознавания речи проверяла сложные слова в фонемах, включая лексический тон. Отдельные правила искали паузы в недопустимых местах, отклонения темпа и аномально сжатые слова. В итоге фильтрация отбрасывала 23% исходных записей.
Простое удаление всех неудачных примеров сузило бы покрытие корпуса: сложные фразы исчезали бы чаще обычных. Поэтому ошибки произношения, темпа и длительности отправляли на повторную генерацию до четырёх раз. Записи с неправильными паузами исключали, а для остальных при отсутствии полностью прошедшего варианта сохраняли лучший результат. Такой подход сочетает контроль качества с сохранением трудных текстов.
Финальный ученик содержит 82 млн параметров. Его входной текстовый модуль отдельно направляет тайские фрагменты в TLTK, а английские — в Misaki, после чего объединяет фонемы в общем словаре. Благодаря этому правила чтения цифр, имён и заимствований можно менять до акустической модели, не переобучая её целиком.
Что показали
Авторы оценивали не только долю ошибочных символов в распознанном тексте (CER). Для сложной лексики они ввели Challenge-Set Keyword Accuracy: запись считается правильной, только если распознанная речь содержит ожидаемую форму целевого имени, редкого слова, неформального написания или Thai–English выражения.
Wayu-Paxa-TTS-Edge получил 68,2% на этом наборе против 72,8% у OmniVoice. Сжатие до фиксированной модели, по интерпретации авторов, сильнее всего затронуло редкие лексические конструкции, а не сохранение голоса или структуру пауз.
При этом точность пауз — доля обнаруженных пауз, попавших в допустимые позиции, — составила 91,4% против 89,9% у учителя. Авторы также измерили у ученика меньше пауз внутри слов и меньше ошибок размещения пауз. Это показывает, что ученик не обязан повторять все дефекты генератора: отфильтрованный корпус может улучшить отдельное поведение относительно исходной модели.
Повторная генерация учителем чаще находила правильное произношение сложных выражений, но не устраняла все ошибки. Неразрешённые случаи концентрировались на словах, которые редко встречались или отсутствовали в проанализированной части обучающих данных OmniVoice. Фильтрация способна выбирать удачные варианты только в пределах того, что учитель вообще умеет генерировать.
Ограничения
Проверка сложной лексики проведена на 1531 предложении, а CER — на 500 тайских фразах. Данные охватывают имена, редкие слова, неформальные формы, длинные предложения и переключение между Thai и English, но не представляют все домены разговорной речи. Корпус для обучения полностью синтетический и зависит от ошибок OmniVoice, автоматического распознавания и правил преобразования текста в фонемы.
Оценки произношения и пауз автоматические. Работа не устанавливает естественность речи по оценкам носителей языка, а эксперимент с диалектом Isan, как отмечают авторы, не проверяет естественность и точность передачи диалекта. Заявление о работе на устройстве не дополнено замерами задержки, потребления памяти, энергии или производительности на конкретном оборудовании.
В итоговом сравнении есть OmniVoice и Gemini 3.1 Flash TTS, но нет других компактных Thai TTS с фиксированным голосом. Для Gemini размер модели взят как косвенная нижняя оценка из литературы, а сравнение сходства голоса использует другие эталонные записи. Поэтому таблица показывает положение внутри выбранной авторами постановки, но не отвечает, какая компактная архитектура лучше для промышленного внедрения.
Что это значит
Работа не требует менять планы команд, у которых уже есть лицензированный корпус записей и проверенная компактная TTS. Для проектов без такого корпуса она добавляет практический вариант: использовать большую модель временно, как генератор данных, а в продукт поставлять фиксированного ученика без клонирования голоса при каждом запросе.
Главный инженерный вывод относится к конвейеру данных. Нельзя ограничиться генерацией большого числа аудиофайлов и обучением на всём результате. Нужны отдельные проверки произношения, тона, пауз и темпа, а также повторная генерация, которая не позволяет сложным фразам исчезнуть из корпуса. Полезно хранить причины отклонения записей и контролировать покрытие по категориям текста.
Нормализацию цифр, имён, заимствований и переключения языков стоит держать вне акустической модели. Авторы исправляли часть ошибок изменениями входного текстового модуля без переобучения генератора речи. Для продукта это означает более короткий цикл исправлений и возможность добавлять словари конкретного домена.
Для производственного решения результатов пока недостаточно. Понадобятся собственные тесты на текстах продукта, прослушивание носителями языка и замеры на целевом оборудовании. Отдельное условие — подтверждённое согласие и лицензия на образец голоса: тот же конвейер, который удешевляет создание корпоративного голоса, упрощает и несанкционированное копирование.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



