Журнал · Rit.work

Тест следующего шага переоценил ИИ-агентов для поддержки

Дообучение улучшило отдельные ответы Qwen3 и Gemma 3, но почти не помогло моделям самостоятельно завершать клиентские процессы с вызовами инструментов.

Rit.work
Студия разработки
21 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Улучшение ответа на следующем шаге не показало, способен ли ИИ-агент довести клиентский процесс до конца. В препринте Dialpad, который не прошёл рецензирование и содержит замеры самих авторов, лучший агент завершил лишь 10,4% сценариев с инструментами, а целиком корректно не выполнил ни одного. Для выбора модели это меняет критерий приёмки: качество отдельных ответов надо проверять отдельно от полного прогона.

Команда сравнила Qwen3 и Gemma 3 двух размеров до и после дообучения с учителем. В одном режиме модель на каждом шаге получала правильную историю диалога и предсказывала следующее действие. В другом она продолжала процесс после собственных ответов и вызовов инструментов, поэтому ранняя ошибка меняла все последующие шаги.

После дообучения доля успешных текстовых ответов при правильной истории выросла в среднем на 25,2 процентного пункта. Для действий с инструментами прирост составил только 5,9 пункта. Общая метрика следующего шага росла в основном за счёт текста и не показывала, умеет ли агент сохранять состояние процесса.

Даже формальное завершение цепочки вызовов не означало, что задача решена. Модель могла пропустить нужные сведения, нарушить правила предметной области, неправильно использовать результат инструмента или дать неверный ответ пользователю.

Проверка охватывала 84 синтетических диалога из одного закрытого набора клиентской поддержки. Точный автоматический тест требовал совпадения инструмента и аргументов с эталоном, а пользователь отвечал по заранее заданному сценарию; такой протокол может отклонять допустимые альтернативные действия.

В отчёте об агенте одной средней оценки недостаточно. Нужны отдельные показатели для качества текста, правильности следующего действия, точности вызовов инструментов и завершения всей задачи без ошибок и нарушений правил.

Источники

Иллюстрация: рисунок из статьи «When Better Turns Do Not Make Better Agents: Diagnosing the Gap Between Next-Turn Metrics and Workflow Success», Md Tahmid Rahman Laskar, Xue-Yong Fu, Gundeep Singh и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу