Журнал · Rit.work

Рейтинг ИИ-агентов зависит от обвязки и задачи

Сравнение агентных систем показывает, что модель нельзя выбирать отдельно от инструментов, правил повторных попыток и целевых задач.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Одна и та же модель может оказаться лидером или проиграть в зависимости от программной обвязки агента. В препринте команды Nanyang Technological University, который не прошёл рецензирование и где цифры получили сами авторы, Claude опередил GPT в OpenHands на 7,94 пункта, но отстал в PI на 30,16 пункта. Поэтому рейтинг моделей не заменяет проверку всей связки на задачах будущего продукта.

Лидер меняется вместе с обвязкой

Обвязка — это программный слой вокруг модели. Она предоставляет инструменты, хранит контекст, возвращает ошибки, повторяет вызовы и решает, когда агент закончил работу.

В задачах Terminal-Bench 4 Claude оказался сильнее GPT только с OpenHands. В DeepSeek Harness, PI и openJiuwen порядок поменялся: GPT вышел вперёд. Разница возникла не из-за новой модели или другого набора заданий — менялся только слой, через который модель действовала.

Смена задачи тоже переставляет лидеров. Лучшая обвязка для Claude, GPT, GLM и DeepSeek зависела от набора заданий. Устойчивая связка нашлась у Kimi: openJiuwen давал ей лучший результат в каждом наборе с преимуществом от 5,61 до 11,11 пункта над ближайшей альтернативой.

Обвязка поставщика модели не получила автоматического преимущества. Claude Code выиграл часть сравнений для Claude, но уступил OpenHands на сложных терминальных задачах. Codex ни в одном наборе не стал лучшим вариантом для GPT.

Цена также зависела от пары. На одном наборе GPT с PI стоил $4,66 на задачу, а с DeepSeek Harness — $19,94, хотя PI показал более высокий результат. Более дорогая конфигурация здесь делала больше вызовов модели и повторно передавала больше контекста, но не решала больше задач.

Ошибку определяет не только модель, но и способ вернуть сбой

Разбор одинаковых задач показал, почему пары ведут себя по-разному. Модели обычно сами начинали исправлять ошибку, если получали понятный сигнал. Когда зависшая команда не возвращала результат или защитный механизм завершал цикл после неверного вызова инструмента, исправлять было уже нечего: модель не видела причину остановки.

GPT хорошо работал с лаконичной обвязкой PI, потому что сам задавал ограничения времени для команд. Kimi чаще формировал некорректные вызовы инструментов и выигрывал от openJiuwen, где операции записи и редактирования разделены, а ошибки возвращаются в пригодном для исправления виде.

Ещё один источник сбоев — проверка готового результата. Агент мог придумать собственный критерий, выполнить его и объявить задачу законченной, хотя внешний проверяющий находил 123 неверных пикселя из 61 440. Дополнительная просьба всё перепроверить не помогала: модель снова использовала тот же ошибочный критерий.

Отсюда следуют разные меры. Неверные аргументы инструмента, зависшие команды и преждевременную остановку дешевле исправлять в обвязке: возвращать структурированную ошибку, ограничивать время выполнения и давать агенту возможность продолжить. Выбор подходящего критерия готовности требует уже другой модели поведения, а не ещё одного общего напоминания.

Планы меняются: тестировать нужно матрицу, а не одну модель

Для команды, которая строит агента, единицей выбора становится строка «модель × обвязка × задача». Сначала стоит зафиксировать рабочий набор заданий и внешний критерий успеха, затем прогнать несколько сочетаний и сравнить не только итоговую оценку, но и стоимость, остановки и способы восстановления после ошибок.

  • Сохранять одинаковые задачи. Иначе нельзя отделить эффект обвязки от изменения нагрузки.
  • Считать полную стоимость пары. В неё входят вызовы модели через API, повторная передача контекста и вспомогательные обращения, которые делает обвязка.
  • Сопоставлять траектории. Для проваленной задачи полезно сравнить запуск той же модели в другой обвязке и найти шаг, после которого результаты разошлись.
  • Проверять критерий завершения отдельно. Самопроверка агента не должна подменять условие, которое использует продукт или внешний проверяющий.

Работа охватывает OpenHands, DeepSeek Harness, PI, openJiuwen и две обвязки поставщиков, модели от Anthropic, OpenAI, Z.ai, Moonshot AI и DeepSeek, а также TUA-Bench, ALE-CLI и набор сложных терминальных заданий. В зачёт брали последний запуск каждой задачи; настройки, доступные инструменты и бюджеты выполнения между обвязками полностью не выравнивали, а разброс между повторными запусками не измеряли.

Эти границы не позволяют объявить универсально лучшую обвязку. Но они меняют процедуру выбора: обновление модели внутри работающего агента и перенос агента на другой тип задач требуют нового прогона матрицы, даже если прежняя связка уверенно лидировала.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу