Журнал · Rit.work

EarlyEval предсказывает исход теста до завершения ИИ-агента

EarlyEval останавливает оценочные прогоны ИИ-агентов, когда классификаторы уже могут предсказать успех или неудачу задачи.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из Shanghai Jiao Tong University, Singapore Management University и East China Normal University представили EarlyEval в препринте, который не проходил рецензирование. По замерам авторов, система сокращала число шагов оценочного прогона на 13–26%. Подход важен командам, которые многократно проверяют новые модели, инструкции и агентные оболочки на одних и тех же наборах задач.

Что сделали

EarlyEval наблюдает за выполнением задачи и после каждого шага оценивает, можно ли уже предсказать конечный успех или неудачу. Для этого используются два классификатора LightGBM: один ищет признаки успеха, другой — признаки провала. Если уверенность одного из них превышает заранее настроенный порог, прогон прекращается, а предсказанный исход записывается как результат задачи.

Классификаторы учитывают действия агента, ошибки, результаты тестов, повторяющиеся операции и текст взаимодействия со средой. Если в наборе есть эталонное решение, система также сопоставляет с ним промежуточное состояние. Обучение проводится на завершённых и размеченных траекториях других агентов; проверяемого агента авторы исключали из обучающей выборки. Эксперименты охватили более 21 тысячи траекторий на SWE-bench Verified, TerminalBench и Toolathlon.

Что это значит

EarlyEval предназначен не для ускорения самого агента, а для сокращения стоимости повторных оценок во время разработки. По измерениям авторов, точность раннего предсказания составляла 89–97%, а средняя доля решённых задач отклонялась от полного прогона примерно на один-два процентных пункта. Поэтому метод подходит для сравнения промежуточных версий, но авторы рекомендуют получать итоговые публикуемые результаты полным прогоном.

Ограничения. Метод проверяли только на трёх стабильных оценочных наборах и на накопленных траекториях известных агентных конфигураций. Для нового набора без завершённых размеченных прогонов обучить классификаторы нельзя. Проверка с исключением одного агента показывает перенос на другую конфигурацию внутри того же набора, но не подтверждает перенос на принципиально новые среды. В сравнении с моделью-оценщиком на Qwen авторы сопоставили точность и сокращение шагов, однако не привели сквозной замер денежных затрат и времени с учётом работы самой системы остановки.

Источники

Иллюстрация: рисунок из статьи «EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction», Yuling Shi, Zhensu Sun, Junsen Dong и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу