Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Для ИИ-помощников программиста создали SWE-Journey — бенчмарк, где требования поступают постепенно, а код меняется на протяжении всей беседы. В препринте Tencent Hy AI Data и Beijing Zhongguancun Academy, который не прошёл рецензирование и приводит замеры самих авторов, модели выполняли свыше 75% тестов при работе с архитектором ПО, но менее 25% — с пользователем без навыков программирования. Значит, проверка по одному подробно сформулированному заданию может завышать надёжность помощника для массового продукта.
Задания строят вокруг существующего репозитория. Более сильная модель составляет план, а более слабая последовательно реализует его части; каждое продолжение расширяет уже изменённый код. Для нового поведения создают тесты, которые не проходят до эталонной правки и проходят после неё, а прежнее поведение защищают отдельными тестами на регрессии. Независимая модель проверяет, совпадают ли запрос, критерии приёмки и исполняемые тесты.
Такой конвейер превращает короткую исходную задачу в цепочку зависимых изменений. Синтез одного длинного задания стоил $56,64. Это не только способ собрать набор дешевле ручной разработки: новые продолжения уменьшают риск, что помощник найдёт готовое решение в истории публичного репозитория.
Манеру общения воспроизводит модель пользователя. Её настройки получили из диалогов SWE-Chat и свели к типам: человек без навыков программирования, менеджер продукта, начинающий разработчик и архитектор ПО. Симулятор постепенно раскрывает требования, исправляет помощника и меняет степень контроля в зависимости от хода работы. Поэтому бенчмарк проверяет три разных умения: уточнить реальную задачу, найти нужный участок кода и действительно исправить проблему, не убедив себя преждевременно, что всё готово.
Проверку провели на 30 синтезированных заданиях в изолированных контейнерах: помощник и симулятор работали с одним изменяющимся репозиторием, а тесты запускались по ходу сессии. Пользователи здесь синтетические, хотя их типы выведены из реальных диалогов; на создание заданий и основные эксперименты ушло $16 000. Поэтому SWE-Journey полезнее как схема для собственного испытательного стенда, чем как окончательная таблица лидеров: в неё можно подставить репозитории, требования и типы пользователей конкретного продукта.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



