Журнал · Rit.work

Аудио-LLM можно остановить до ответа на неверно услышанный запрос

Классификатор на скрытых представлениях аудиокодера распознаёт ненадёжную расшифровку до генерации ответа и точнее оценивает риск при смене акустических условий.

Rit.work
Студия разработки
28 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Ненадёжную расшифровку голосового запроса можно распознать до того, как аудио-LLM начнёт отвечать. В препринте Apple и University of California San Diego, который не проходил рецензирование, числа получили сами авторы: предложенный предиктор достиг макро-F1 81,10% на знакомом распределении и 78,09% при смене речи и акустики. Голосовой продукт может запросить повтор записи до того, как модель уверенно ответит на неверно понятый вопрос.

Надёжность измеряли для каждой пары речи и помехи

Обычная оценка качества записи не отвечает на главный вопрос: сможет ли конкретная аудио-LLM расшифровать конкретную фразу. Два файла с похожим уровнем шума могут дать разные результаты из-за содержания речи, характера помехи и особенностей модели.

Для разметки брали запись с эталонной расшифровкой, фиксировали источник шума и постепенно меняли отношение сигнала к шуму. После каждого изменения модель расшифровывала запись, а результат сравнивали с эталоном. Двоичный поиск находил границы, на которых менялась доля ошибочно распознанных слов.

Каждую запись относили к одному из четырёх состояний: расшифрована без ошибок, получила небольшие искажения, умеренные искажения или серьёзные искажения. Границы между последними состояниями проходили при доле ошибочных слов в 10% и 30%. Для каждой пары речи и помехи получался свой набор границ, который сохраняли в банке меток.

Такой способ требует эталонного текста и повторных запусков модели, но только на этапе подготовки данных. После этого из допустимых интервалов отношения сигнала к шуму собирают обучающие примеры, где класс отражает поведение целевой модели, а не условную громкость помехи.

Сигнал об ошибке находится внутри аудиокодера

Самооценка через запрос к самой модели работала плохо: декодер склонялся к ответу, что запись будет расшифрована надёжно, даже когда фактическая ошибка была высокой. Примеры в контексте частично снижали эту уверенность, но не устраняли расхождение.

Авторы вместо декодера использовали скрытые представления аудиокодера. Он преобразует запись в последовательность признаков по времени. Обучаемый модуль назначает вес каждому фрагменту, сводит последовательность к одному представлению записи, а двухслойный классификатор выбирает класс надёжности.

Сам аудиокодер остаётся замороженным. Предиктор работает до генерации текста и не требует менять параметры аудио-LLM. В рабочем запросе кодер всё равно обрабатывает запись, поэтому поверх существующего пути добавляются только временное объединение признаков и классификатор.

Макро-F1 усредняет баланс точности и полноты по всем классам, чтобы частый класс не скрыл ошибки на редких. Предложенный метод обошёл сильнейшие альтернативы на 10,33 пункта внутри исходного распределения и на 11,93 пункта при переносе. Среди сравнений были модели качества речи, неопределённость токенов при генерации и оценка ошибки по уже созданной расшифровке.

Проверка охватывала Qwen2-Audio-7B-Instruct, Phi-4-Multimodal-Instruct и MOSS-Audio-8B. Для обучения использовали речь LibriSpeech, помехи DNS Challenge и MUSAN, а также моделируемую реверберацию OpenSLR26. При переносе речь заменили на LJSpeech, окружающие шумы — на SONYC-UST, а отклики помещений — на реальные записи OpenSLR28. Результат относится к контролируемым смесям речи, музыки, окружающего шума и реверберации.

Командам нужен отдельный контур перед генерацией

Работа меняет архитектурный план голосового продукта: проверку надёжности стоит ставить сразу после аудиокодера, а не после расшифровки или ответа. Система может пропустить уверенно распознанный запрос дальше, а для сомнительной записи попросить пользователя повторить фразу, подойти ближе к микрофону или убрать источник шума.

Такой контур не стоит считать универсальным фильтром, который одинаково работает с любой моделью. Метки строятся по ошибкам конкретной аудио-LLM, поэтому при замене семейства меняются границы между надёжной и ненадёжной записью. Перенос между Qwen2 и Phi-4 сохранил качество лучше, чем перенос на MOSS.

Полный банк меток для новой модели может не понадобиться. В одном из опытов границы скорректировали по 5% общих пар речи и помехи, после чего потеря точности при переносе с Phi-4 на MOSS сократилась с 12,9 до 2,1 пункта. Практический план — переиспользовать исходную разметку, измерить расхождение на небольшой общей части и сдвинуть границы классов под целевую модель.

Перед внедрением команде всё равно понадобится собственный набор характерных записей: звонки, голосовые команды или сообщения с теми микрофонами и шумами, которые встречаются в продукте. Работа показывает место для защитного механизма и способ его обучить, но порог запроса уточнения придётся выбирать вместе с продуктовой политикой: лишний повтор раздражает пользователя, а пропущенная ошибка запускает действие по неверно понятой команде.

Источники

Иллюстрация: рисунок из статьи «Audio LLMs Know When They Can't Hear You», Amirhosein Javadi, Richa Dixit, Mehrdad Farajtabar и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу