Журнал · Rit.work

TRACE отделяет сбой агента от сбоя оценки

Протокол TRACE показывает, как выяснить, вызван новый балл поведением ИИ-агента, случайностью запуска или правилами автоматической проверки.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Разницу в баллах ИИ-агентов научились раскладывать на изменение поведения и ошибку автоматической проверки. В препринте Radhika Gaonkar, который не прошёл рецензирование и где числа получены автором работы, одинаковые повторные запуски меняли исход 15–36% заданий. Поэтому единичный замер не позволяет уверенно сравнивать модели или выбирать награду для обучения.

Протокол TRACE сначала вносит одно целевое изменение: например, переименовывает инструменты, не меняя их функций. Затем он сопоставляет запуски, проверяет последовательности действий и повторно оценивает неизменившуюся траекторию после исправления предполагаемого дефекта проверки. Идентичный повтор показывает обычный разброс, а заведомо значимое изменение подтверждает, что испытание вообще способно обнаружить эффект.

В контролируемой среде заданный программой агент выполнил те же операции, но после переименования инструментов потерял 0,250 балла. Проверка искала исходные названия, а не фактические действия. Когда названия восстановили только на этапе оценки, разрыв сократился до нуля; у другого агента он сохранился, потому что тот действительно изменил поведение.

Работу проверяли на 25 искусственных заданиях, а затем на 88 новых заданиях τ2-bench из сфер авиаперевозок и розничной торговли с четырьмя LLM-агентами. Для семи из восьми сочетаний агента и безвредного изменения награда осталась в пределах ±0,10, тогда как намеренно вводящие в заблуждение названия снизили её у всех агентов на 0,20–0,44. Две модели-оценщика при этом разошлись в вердиктах по 57% одинаковых записей: одна чаще судила результат, другая — соблюдение процедуры.

Если балл изменился после обновления модели или интерфейса, сначала стоит повторить исходный запуск, затем сравнить действия и состояние задачи, а подозрительную проверку применить заново к той же записи. Вместе с разницей баллов нужен абсолютный процент успешно выполненных заданий: стабильно низкий результат может выглядеть устойчивостью, хотя агент просто одинаково плохо работает в обоих условиях.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу