Журнал · Rit.work

NemotronLabs VoiceChat совмещает полный дуплекс и вызов инструментов

Открытая голосовая модель одновременно слушает, отвечает и вызывает внешние инструменты, но пока чаще ошибается в аргументах и цепочках вызовов.

Rit.work
Студия разработки
21 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Открытая голосовая модель научилась одновременно слушать собеседника, отвечать и вызывать внешние инструменты. В препринте, который не проходил рецензирование, приведены замеры самих авторов: NemotronLabs VoiceChat правильно выбирает инструмент в 82,5% случаев, но полностью выполняет задачу лишь в 33%. Такая архитектура подходит для голосовых агентов без каскада отдельных сервисов, однако критичные действия пока требуют проверки.

Полный дуплекс здесь означает, что агент продолжает слушать, пока говорит сам: он может остановиться при перебивании и не принимает короткое «угу» за новую реплику. Потоковый речевой кодировщик передаёт звук языковой модели, а отдельные параллельные каналы выпускают текст ответа, расшифровку речи и структурированный вызов функции. Потоковый синтезатор превращает ответ в звук; пока инструмент работает, система может произнести заранее заданную фразу вместо молчания.

На Full-Duplex-Bench 3.0 модель уверенно определяет нужный инструмент, но хуже заполняет аргументы и собирает цепочки вызовов. Она может пропустить вызов, придумать значение параметра или ответить из внутренних знаний там, где нужно обратиться к функции. После коротких подтверждений собеседника VoiceChat продолжает прежний ответ в 93% случаев, поэтому вызов инструментов не разрушил базовое управление очередностью речи.

Систему проверяли на Full-Duplex-Bench, VoiceBench и наборах OpenASR: тесты охватывают перебивания, паузы, распознавание речи, общие голосовые задачи и сценарии с несколькими API. Контекст обучения ограничен примерно двумя минутами разговора, а для практической работы авторы рекомендуют подключать не больше пяти инструментов за сеанс. Во время выполнения функции пользователь пока не может перебить агента, поэтому модель скорее задаёт основу открытого голосового контура, чем готовый исполнитель для операций с высоким риском.

Источники

Иллюстрация: рисунок из статьи «NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities», Jagadeesh Balam, Travis Bartley, Edresson Casanova и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу