Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из Shanghai Jiao Tong University, Singapore Management University и East China Normal University представили EarlyEval в препринте, который не проходил рецензирование. По замерам авторов, система сокращала число шагов оценочного прогона на 13–26%. Подход важен командам, которые многократно проверяют новые модели, инструкции и агентные оболочки на одних и тех же наборах задач.
Что сделали
EarlyEval наблюдает за выполнением задачи и после каждого шага оценивает, можно ли уже предсказать конечный успех или неудачу. Для этого используются два классификатора LightGBM: один ищет признаки успеха, другой — признаки провала. Если уверенность одного из них превышает заранее настроенный порог, прогон прекращается, а предсказанный исход записывается как результат задачи.
Классификаторы учитывают действия агента, ошибки, результаты тестов, повторяющиеся операции и текст взаимодействия со средой. Если в наборе есть эталонное решение, система также сопоставляет с ним промежуточное состояние. Обучение проводится на завершённых и размеченных траекториях других агентов; проверяемого агента авторы исключали из обучающей выборки. Эксперименты охватили более 21 тысячи траекторий на SWE-bench Verified, TerminalBench и Toolathlon.
Что это значит
EarlyEval предназначен не для ускорения самого агента, а для сокращения стоимости повторных оценок во время разработки. По измерениям авторов, точность раннего предсказания составляла 89–97%, а средняя доля решённых задач отклонялась от полного прогона примерно на один-два процентных пункта. Поэтому метод подходит для сравнения промежуточных версий, но авторы рекомендуют получать итоговые публикуемые результаты полным прогоном.
Ограничения. Метод проверяли только на трёх стабильных оценочных наборах и на накопленных траекториях известных агентных конфигураций. Для нового набора без завершённых размеченных прогонов обучить классификаторы нельзя. Проверка с исключением одного агента показывает перенос на другую конфигурацию внутри того же набора, но не подтверждает перенос на принципиально новые среды. В сравнении с моделью-оценщиком на Qwen авторы сопоставили точность и сокращение шагов, однако не привели сквозной замер денежных затрат и времени с учётом работы самой системы остановки.
Источники
Иллюстрация: рисунок из статьи «EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction», Yuling Shi, Zhensu Sun, Junsen Dong и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



