Журнал · Rit.work

Как измерить вклад обвязки в кодинг-агента

Парное сравнение на приватных задачах отделило вклад модели от инструментов, подсказок и логики, которые управляют кодинг-агентом.

Rit.work
Студия разработки
14 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Фирменная агентская обвязка не решила больше задач, когда модель оставалась той же. В препринте evolutionID GmbH, который не рецензирован и содержит замеры самого автора, разница между обвязками для обеих основных моделей составила всего 1,25 процентного пункта и осталась в пределах погрешности. Значит, привязка к инструментам поставщика сама по себе не гарантирует более точного кодинг-агента.

Обвязка здесь — это инструменты, системные подсказки, правила сокращения контекста и логика управления агентом. Чтобы отделить её эффект от возможностей LLM, одну модель запускали на одинаковых задачах с двумя вариантами: фирменным claude-agent-sdk или openai-codex SDK и нейтральным deepagents. Каждый запуск проходил в отдельной виртуальной машине, а готовую правку проверяла изолированная система со скрытыми тестами.

Почти одинаковый средний результат скрыл зависимость от типа работы. На claude-opus-4-8 фирменная обвязка уступила deepagents на репозиторных задачах на 9 процентных пунктов, но опередила её на конкурсных задачах на 23,7 пункта. Это деление выбрали после просмотра результатов, поэтому его стоит считать основанием для следующего эксперимента, а не готовым правилом выбора.

Нейтральная обвязка по фактическому расходу токенов стоила в 1,2–1,6 раза больше на одну решённую задачу. Однако порядок по итоговому счёту Anthropic определить не удалось. Первая версия расчёта также дважды учитывала часть токенов из кеша: исправление показывает, что при сравнении обвязок нужно сверять исходные события каждого API, внутренний журнал и списания провайдера.

Основные сравнения провели на 80 задачах, выбранных из приватного набора из 256 репозиторных и опубликованных после границы обучения конкурсных задач. Выборка специально чаще включала случаи, где фирменные связки расходились, поэтому средние результаты относятся к этому пулу, а не ко всем задачам разработки. Код оркестратора, проверки и повторного анализа доступен, но сами задания оставлены закрытыми, чтобы они не попали в обучающие данные.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу