Журнал · Rit.work

Обвязка агента меняет место модели в лидерборде

Рейтинг готовых агентных систем может быть устойчивым, даже если тот же тест ненадёжно сравнивает базовые модели: добавление однотипных задач эту проблему не решает.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Добавление новых однотипных задач не всегда делает лидерборд ИИ-агентов надёжнее: выбор программной обвязки способен поменять порядок моделей. В пока не рецензированном препринте, где числа получили сами авторы, надёжность рейтинга готовых систем составила от 0,935 до 0,994, а рейтинга базовых моделей — от 0,148 до 0,841. Поэтому результат теста нельзя переносить с готового агента на модель без отдельной проверки.

Работа разделяет два объекта оценки. Первый — готовая система из модели и программной обвязки (scaffold), которая хранит состояние, подключает инструменты и превращает ответы модели в действия. Второй — сама модель, результат которой должен сохраняться при смене обвязки.

Для анализа исследователи разложили различия в результатах на вклад моделей, задач, обвязок и их сочетаний. Коэффициент надёжности лежит между нулём и единицей: чем он ближе к единице, тем меньше рейтинг зависит от конкретных условий теста. Одна обвязка может давать устойчивые результаты внутри себя, но ранжировать модели иначе, чем другая.

Простое расширение набора задач устраняет только неопределённость, связанную с задачами. При неизменном наборе обвязок даже бесконечное число сходно составленных заданий повышало надёжность рейтинга моделей не более чем на 0,097. Иначе говоря, тысячи дополнительных прогонов не исправят перекос, если модели проверяют через слишком узкий набор агентных систем.

Проверка охватила 22 бенчмарка из Holistic Agent Leaderboard и Harbor Index — всего 30 859 запусков на задачах по программированию, работе с вебом, научным вычислениям, поддержке клиентов и общей помощи. Данные были разреженными: модели и обвязки тестировали в разных сочетаниях, что соответствует устройству реальных лидербордов, но ограничивает перенос выводов за представленные типы задач и систем.

Для сравнения моделей полезнее распределять тот же бюджет между разными бенчмарками и обвязками. В расчётах объединение бенчмарков подняло ожидаемую надёжность рейтинга с 0,44 до 0,75 при прежнем числе задач, а распределение запусков с учётом источников неопределённости сокращало расчётную стоимость до 83%.

Источники

Иллюстрация: рисунок из статьи «Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard», Michael Hardy, Ruhana Azam, Anka Reuel и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу