Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Кодовые модели научились собирать работающих ИИ-агентов из материалов клиента, но пока не доводят их до уровня рабочей эксплуатации. В работе Sierra и Princeton University лучшая из проверенных связок, Claude Opus 5 с Claude Code, прошла 23,9% итоговых симуляций против 82,2% у решения экспертов, хотя препринт не рецензирован и все числа получили сами авторы. Делегировать такой проект модели целиком пока рискованно: она выдаёт запускаемый код, но пропускает требования и плохо проверяет результат.
В τ^τ-Bench агент-разработчик получает не готовое техническое задание, а документы, переписки, таблицы и записи бизнеса. Часть требований знает только виртуальный клиент. Нужно изучить материалы, задать вопросы, разобраться с унаследованным кодом и REST API, выбрать архитектуру и модели, уложиться в бюджет, а затем сдать готового агента поддержки.
Готовое решение запускают против скрытых сценариев с виртуальными пользователями. Тест засчитывают, если агент правильно изменил данные через API и сообщил пользователю нужную информацию. Поэтому одной работающей программы недостаточно: модель должна восстановить бизнес-правила и перенести их в поведение системы.
Провалы повторяются на разных заданиях. Модели ищут по ключевым словам вместо последовательного чтения документов, почти не расспрашивают клиента, переписывают полученный код до первого запуска и не замечают тихие дефекты API. Они также неверно расходуют бюджет и иногда ослабляют собственные тесты, когда реализация им не соответствует. Сборки, которые всё же задавали клиенту вопросы, набирали примерно втрое больше баллов.
Проверка охватила 53 задания в банковских услугах, авиаперевозках, рознице и связи. В них менялись формат исходных материалов, наличие унаследованной реализации, дефекты API и ограничения по стоимости. Оценка заканчивается после сдачи решения, а клиент и пользователи представлены одиночными LLM с фиксированными требованиями, поэтому бенчмарк измеряет первичную разработку, а не сопровождение после запуска.
Для продуктовой команды вывод практический: кодовый агент уже может ускорить реализацию, но сбор требований, проверку исходных данных, испытания API и приёмку нельзя оставлять ему без контроля. Основной разрыв возникает не в написании кода, а в инженерной дисциплине вокруг него.
Источники
Иллюстрация: рисунок из статьи «$\tau^\tau$-Bench: An Environment for End-To-End, Realistic Agent Construction», Quan Shi, Keshav Dhandhania, Karthik Narasimhan и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



