Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Первую ошибку в длинном прогоне ИИ-агента можно находить отдельной проверяющей моделью и использовать этот сигнал, чтобы выбрать лучший из нескольких запусков. В нерецензированном препринте, где все числа получены самими авторами, сильнейшая из шести универсальных моделей-оценщиков нашла первый сбой менее чем в трети прогонов, а специально обученный Scout справился лучше. Это добавляет в архитектуру агента слой контроля без переобучения самого агента.
Итоговый балл скрывает раннюю ошибку
Работа команды из University of California, Los Angeles, New York University, Google Research и Google DeepMind охватывает разработку ПО, работу в терминале и биоинформатический анализ. В корпус вошли траектории Claude, GPT, Gemini, DeepSeek, Qwen и Kimi под управлением нескольких агентных каркасов.
Авторы определяют ошибку не как любой неудачный шаг. Это решение или действие, которое противоречит доступным на тот момент сведениям, меняет состояние задачи и уводит прогон от правильного решения. Ответ среды сам по себе ошибкой не считается.
Такое определение позволяет отделить причину от последствий. Некорректная команда часто оказывается лишь следствием более ранней ошибки в рассуждении или плане. После первого сбоя агент восстановил правильный ход только в 30,5% прогонов, а в 38,5% случаев вообще не заметил проблему. Ошибочный шаг делал следующий шаг неверным примерно в 11–14 раз чаще.
Финальная проверка не показывает эту цепочку. Один прогон успешно завершил задачу, но удалил единственную копию длительного эксперимента, освобождая место на диске. Другой выдал придуманный результат вместо вычисленного. Оба могли пройти итоговую проверку, хотя по пути агент совершил необратимое действие.
Как Traverse размечает первый сбой
Для набора Traverse люди просматривали траекторию как последовательность рассуждений, действий и ответов среды. Они отмечали каждый шаг как правильный или ошибочный, а затем указывали самую раннюю ошибку. Если агент позже исправлялся и решал задачу, первый сбой всё равно оставался в разметке.
Проверяли естественные прогоны из SWE-bench, TerminalBench и BixBench длиной до 200 шагов. Поэтому задача отличается от проверки короткой цепочки рассуждений: модель должна удерживать состояние репозитория, терминала или анализа и отличать исходную причину от ошибок, которые накопились позже.
На Traverse испытали шесть универсальных моделей-оценщиков. Ни одна не нашла первый неправильный шаг хотя бы в трети неудачных прогонов, причём увеличение модели само по себе не решило задачу. При простой классификации всего прогона модели тоже ошибались систематически: одни слишком часто браковали правильные траектории, другие пропускали реальные сбои.
Scout обучили специально на пошаговой разметке. Сначала модель с 4 млрд параметров прошла обучение с учителем, затем — обучение с подкреплением. Она должна вернуть позицию первой ошибки либо признать, что вся траектория корректна. Scout обошёл все проверенные универсальные модели и перенёс навык на BixBench, хотя при обучении не видел научные задачи.
Когда отдельная проверка меняет архитектуру агента
Практическая схема состоит из нескольких независимых прогонов. Агент предлагает варианты решения, Scout оценивает их траектории, а система выбирает вариант без найденной ошибки или с наиболее надёжным ходом. Самого агента при этом не дообучают.
Такой отбор прибавил 8,4 процентного пункта на TerminalBench, 2,4 пункта на SWE-bench и 3,1 пункта на BixBench относительно одиночной попытки агента. Наибольший эффект получился в терминальных задачах, где повторный запуск может привести к заметно другой последовательности действий.
Для команды это аргумент в пользу отдельного контура проверки, если система уже умеет делать несколько попыток и сохраняет полную историю действий. Разметку стоит строить вокруг первого решения, после которого задача пошла неверно, а не вокруг последней команды или только итогового ответа. Так данные подходят и для отладки, и для обучения собственного проверяющего компонента.
Scout не заменяет ограничения прав, изоляцию среды и подтверждение необратимых операций. Отбор после завершения прогона не остановит удаление данных, если агент уже получил доступ к рабочей системе. Пошаговая проверка полезна как дополнительный сигнал, но действия с необратимым эффектом нужно блокировать до исполнения.
Источники
Иллюстрация: рисунок из статьи «Locating Hidden Failures Makes Long-Horizon Agents More Reliable», Salman Rahman, Yubin Kim, Mihir Parmar и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



