Журнал · Rit.work

SWE-Journey проверяет ИИ-помощников на длинной дистанции

Новый бенчмарк показывает, как длинные цепочки изменений и манера пользователя влияют на результат работы ИИ-помощника с кодом.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Для ИИ-помощников программиста создали SWE-Journey — бенчмарк, где требования поступают постепенно, а код меняется на протяжении всей беседы. В препринте Tencent Hy AI Data и Beijing Zhongguancun Academy, который не прошёл рецензирование и приводит замеры самих авторов, модели выполняли свыше 75% тестов при работе с архитектором ПО, но менее 25% — с пользователем без навыков программирования. Значит, проверка по одному подробно сформулированному заданию может завышать надёжность помощника для массового продукта.

Задания строят вокруг существующего репозитория. Более сильная модель составляет план, а более слабая последовательно реализует его части; каждое продолжение расширяет уже изменённый код. Для нового поведения создают тесты, которые не проходят до эталонной правки и проходят после неё, а прежнее поведение защищают отдельными тестами на регрессии. Независимая модель проверяет, совпадают ли запрос, критерии приёмки и исполняемые тесты.

Такой конвейер превращает короткую исходную задачу в цепочку зависимых изменений. Синтез одного длинного задания стоил $56,64. Это не только способ собрать набор дешевле ручной разработки: новые продолжения уменьшают риск, что помощник найдёт готовое решение в истории публичного репозитория.

Манеру общения воспроизводит модель пользователя. Её настройки получили из диалогов SWE-Chat и свели к типам: человек без навыков программирования, менеджер продукта, начинающий разработчик и архитектор ПО. Симулятор постепенно раскрывает требования, исправляет помощника и меняет степень контроля в зависимости от хода работы. Поэтому бенчмарк проверяет три разных умения: уточнить реальную задачу, найти нужный участок кода и действительно исправить проблему, не убедив себя преждевременно, что всё готово.

Проверку провели на 30 синтезированных заданиях в изолированных контейнерах: помощник и симулятор работали с одним изменяющимся репозиторием, а тесты запускались по ходу сессии. Пользователи здесь синтетические, хотя их типы выведены из реальных диалогов; на создание заданий и основные эксперименты ушло $16 000. Поэтому SWE-Journey полезнее как схема для собственного испытательного стенда, чем как окончательная таблица лидеров: в неё можно подставить репозитории, требования и типы пользователей конкретного продукта.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу