Журнал · Rit.work

Nubank проверяет агентов поддержки на искусственных клиентах до релиза

Nubank использовал симуляцию диалогов и инструментов, чтобы отбирать версии агентов поддержки перед A/B-тестами и улучшить продуктовые метрики.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Nubank научился отсеивать неудачные версии агентов поддержки до контакта с клиентами. Команда Nubank и Guardrails AI показала в препринте, который не проходил рецензирование и содержит замеры самих авторов, что выбранная таким способом модель с открытыми весами подняла долю обращений без оператора на 8,82 процентного пункта. Это добавляет промежуточный фильтр между локальными тестами и A/B-тестом в продакшене.

Snowglobe создаёт искусственных клиентов с разными задачами и стилями общения. Они реагируют на ответы агента, а имитатор перехватывает вызовы инструментов и возвращает согласованные данные вместо обращения к рабочим системам. Каждую новую версию сравнивают с действующей по заранее выбранному сценарию и критерию, после чего подходящие варианты допускают к тесту на реальных клиентах.

Так команда проверила конфигурации моделей с открытыми весами более чем на 16 000 диалогов. После доработки инструкции выбрали Qwen3.5-122B-A10B: в рабочем A/B-тесте доля диалогов, завершённых без оператора, выросла на 8,82 процентного пункта, а 95-й процентиль задержки снизился на 25%. Удовлетворённость клиентов статистически не изменилась.

Тем же процессом разработали Card Management — расширенную версию агента Card Delivery. В рабочем тесте доля самостоятельного решения обращений выросла на 4,9 процентного пункта. Транзакционный индекс готовности рекомендовать сервис после обращения вырос на 36,69 пункта.

Метод проверяли на Card Delivery и Card Management для клиентов Nubank в Бразилии. На четырёх выпущенных версиях оценки Snowglobe коррелировали с производственными результатами на уровне 0,74. Симуляция работает только до границы инструментов: она не проверяет рабочую реализацию серверных систем, постоянное состояние и побочные эффекты операций. Поэтому она помогает выбирать кандидатов, но не заменяет тестирование интеграций и A/B-тест перед развёртыванием.

Источники

Иллюстрация: рисунок из статьи «Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale», Edesio Alcoba, Kevin Rossell, Aman Gupta и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу