Журнал · Rit.work

I-Parakeet убрал вычисления с плавающей точкой из Conformer на смартфоне

I-Parakeet запускает Parakeet-CTC на мобильном NPU только с целочисленными операциями и работает в 7,5 раза быстрее CPU.

Rit.work
Студия разработки
28 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель распознавания речи Parakeet-CTC на 0,6 млрд параметров удалось целиком запустить на нейропроцессоре смартфона без переноса отдельных операций на CPU. На LibriSpeech test-other доля ошибочно распознанных слов составила 4,97%, хотя работа не прошла рецензирование и числа получил сам автор, Taichi Nishimura. Результат показывает, что Conformer можно адаптировать к целочисленному мобильному ускорителю, не меняя всю архитектуру.

Какие операции мешали остаться на NPU

Обычного квантования модели оказалось недостаточно. Часть численно чувствительных операций Conformer продолжала использовать вычисления с плавающей точкой, поэтому устройство передавало их на CPU и не могло выполнить весь граф модели на целочисленном NPU.

Первым препятствием стало самовнимание с относительной позицией. В нём две ветви рассчитывают оценки внимания с разными масштабами квантования, после чего модель применяет сдвиг относительных позиций. I-Parakeet объединяет эти ветви и сдвиг в последовательность целочисленных операций.

Вторым препятствием стала функция активации Swish. Автор заменил её приближением, оптимизированным по минимаксному принципу: оно уменьшает наибольшую ошибку между исходной функцией и её целочисленной заменой. Такой критерий контролирует худшее отклонение, а не только среднюю точность приближения.

Третья часть работы касается диапазонов активаций. Послойный анализ показал два проблемных места: выход BatchNorm и активации перед энкодером с распределением, где редкие значения далеко уходят от основной массы. Для первого автор использовал 16-разрядную целочисленную сетку, для второго — калибровку по процентилям.

Вместе эти изменения убрали из графа операции с плавающей точкой и резервное выполнение на CPU. Модель остаётся на мобильном NPU от входа до выхода, поэтому целочисленный ускоритель обрабатывает не отдельные слои, а весь Conformer.

Скорость измерили на Qualcomm NPU

I-Parakeet получил коэффициент реального времени RTF 0,048. Этот показатель сравнивает время обработки с длительностью аудиозаписи: чем он ниже, тем быстрее модель распознаёт речь.

Относительно базового запуска на CPU модель работает в 7,5 раза быстрее. Это итоговый результат всей целочисленной реализации: абстракт не разделяет выигрыш между новым вниманием, приближением Swish и настройкой диапазонов активаций.

Проверка охватывает одну модель — NVIDIA Parakeet-CTC, набор LibriSpeech test-other, Qualcomm NPU и базовый вариант на CPU. Поскольку полный текст получить не удалось и материал подготовлен по абстракту, из него нельзя восстановить точный протокол замеров, конфигурации устройств и разницу в качестве с исходной версией модели.

Поэтому абсолютная доля ошибок показывает, что целочисленный вариант сохранил работоспособность на стандартной задаче распознавания речи, но не отвечает отдельно на вопрос, сколько качества стоил отказ от вычислений с плавающей точкой. Для выбора модели это сравнение придётся провести на собственных записях.

Что меняется в планах мобильных команд

Работа меняет порядок прототипирования локального распознавания речи. Квантовать веса и основные матричные операции недостаточно: сначала стоит проверить весь вычислительный граф и найти места, где среда выполнения переключается с NPU на CPU.

I-Parakeet показывает три класса таких мест: позиционное внимание, нелинейные функции и слои с неудобными диапазонами активаций. Для каждого потребовалось отдельное решение. Поэтому обещанная платформой поддержка целочисленных моделей ещё не означает, что крупный Conformer целиком останется на ускорителе.

Для продукта на Qualcomm NPU работа служит основанием запустить технический прототип с Parakeet-CTC или близкой архитектурой. В прототипе нужно отдельно измерить долю ошибочно распознанных слов, RTF и наличие переходов на CPU на целевом смартфоне. Переносить опубликованный результат между разными NPU без повторных замеров нельзя: поддерживаемые операции и диапазоны чисел зависят от конкретной среды выполнения.

Менять уже выбранную модель только на основании препринта рано. Работа подтверждает техническую возможность полностью целочисленного Conformer на мобильном NPU, но решение для продукта зависит от качества на его речи, целевого устройства и сравнения с более компактными моделями. Практический вывод уже применим: при оценке мобильного ASR следует проверять не только размер квантованной модели, но и то, где фактически выполняется каждая операция.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу