Журнал · Rit.work

Голосовой агент может убедить клиента, но не провести платёж

VAmoS Energy проверяет голосовых агентов на многошаговых звонках с фоновыми голосами и показывает, почему успешного диалога недостаточно для оценки результата.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появился тест для голосовых агентов, где один звонок объединяет несколько просьб, фоновые голоса и изменения в состоянии счетов. В работе Veris AI, которая не прошла рецензирование и приводит числа, полученные самими авторами, даже лучшая конфигурация выполнила все требования лишь в 44,7% звонков. Для запуска в производстве недостаточно проверять, насколько убедительно агент разговаривает: нужно сверять его слова с действиями в подключённых сервисах.

VAmoS Energy состоит из 100 звонков по оплате коммунальных услуг. В каждом клиент формулирует от двух до четырёх связанных просьб: например, уточняет состояние счёта, согласовывает платёж и меняет способ получения квитанций. Агент работает со Stripe billing twin и Apache Fineract, а доступ к данным открывается только после проверки личности. Каждый звонок получает отдельную копию состояния сервисов, поэтому действия одного агента не влияют на следующие попытки.

Модель-оценщик сопоставляет расшифровку разговора с вызовами инструментов и их результатами. Она проверяет произнесённые суммы, изменения счёта и порядок действий — например, запросил ли агент согласие до создания рассрочки. При калибровке её решения совпали с проверяющей программой в 99,1% случаев, хотя обе проверки могут ошибаться.

На 14 конфигурациях доля полностью выполненных звонков составила от 17,3% до 44,7%. Телевизор на фоне снизил общий результат с 38,7% до 8,6%: агенты принимали реплики передачи за слова клиента, отвечали на них или прерывали собственный ответ. В 54,2% звонков, которые виртуальный клиент счёл успешными, итоговая проверка нашла нарушение. Клиент слышал обещание провести платёж, но не видел, выполнил ли агент нужное действие.

Проверяли один сценарий коммунального обслуживания с правилами на основе норм Пенсильвании, двумя типами поведения клиента и несколькими видами фонового звука. Задачи заранее отбирали как трудные и повторяли с меняющимися разговорами, поэтому результаты показывают пригодность методики и уязвимые места конфигураций, а не среднюю успешность всех голосовых агентов.

Источники

Иллюстрация: рисунок из статьи «VAmoS Part Deux: Harder, More Realistic Voice-Agent Simulation», Joshua Meyer, Sahar Shayegan, Ritiz Tambi и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу