Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Nubank научился отсеивать неудачные версии агентов поддержки до контакта с клиентами. Команда Nubank и Guardrails AI показала в препринте, который не проходил рецензирование и содержит замеры самих авторов, что выбранная таким способом модель с открытыми весами подняла долю обращений без оператора на 8,82 процентного пункта. Это добавляет промежуточный фильтр между локальными тестами и A/B-тестом в продакшене.
Snowglobe создаёт искусственных клиентов с разными задачами и стилями общения. Они реагируют на ответы агента, а имитатор перехватывает вызовы инструментов и возвращает согласованные данные вместо обращения к рабочим системам. Каждую новую версию сравнивают с действующей по заранее выбранному сценарию и критерию, после чего подходящие варианты допускают к тесту на реальных клиентах.
Так команда проверила конфигурации моделей с открытыми весами более чем на 16 000 диалогов. После доработки инструкции выбрали Qwen3.5-122B-A10B: в рабочем A/B-тесте доля диалогов, завершённых без оператора, выросла на 8,82 процентного пункта, а 95-й процентиль задержки снизился на 25%. Удовлетворённость клиентов статистически не изменилась.
Тем же процессом разработали Card Management — расширенную версию агента Card Delivery. В рабочем тесте доля самостоятельного решения обращений выросла на 4,9 процентного пункта. Транзакционный индекс готовности рекомендовать сервис после обращения вырос на 36,69 пункта.
Метод проверяли на Card Delivery и Card Management для клиентов Nubank в Бразилии. На четырёх выпущенных версиях оценки Snowglobe коррелировали с производственными результатами на уровне 0,74. Симуляция работает только до границы инструментов: она не проверяет рабочую реализацию серверных систем, постоянное состояние и побочные эффекты операций. Поэтому она помогает выбирать кандидатов, но не заменяет тестирование интеграций и A/B-тест перед развёртыванием.
Источники
Иллюстрация: рисунок из статьи «Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale», Edesio Alcoba, Kevin Rossell, Aman Gupta и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



