Журнал · Rit.work

AgentPProf сводит затраты ИИ-агентов в график пламени

AgentPProf группирует длинные траектории ИИ-агентов по задачам и показывает, какие этапы потребляют токены, время и системные ресурсы.

Rit.work
Студия разработки
18 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Длинные траектории ИИ-агентов научились сводить в профиль, который показывает затраты по задачам и этапам работы. В препринте, который не рецензирован и приводит числа из замеров самих авторов, AgentPProf улучшил точность поиска проблем до 56% относительно исходных средств диагностики. Команда может искать общий источник расходов сразу по серии запусков, а не читать каждую трассировку отдельно.

Как операция заменяет функцию в профиле

Обычный профилировщик связывает процессорное время или память с функциями в стеке вызовов. У агента такого стека нет: запросы, вызовы LLM, команды инструментов и файловые операции следуют друг за другом, но не образуют устойчивую иерархию.

AgentPProf приводит все события к одному типу — операции. Запрос, вызов модели, запуск процесса, чтение файла и сетевое обращение получают строковые поля с проектом, агентом, моделью, путём и состоянием, а также складываемые показатели: токены, длительность или количество событий.

Из полей собирается семантический стек операций. Его уровни выбирают во время запроса, поэтому один набор записей можно сгруппировать по задаче, сеансу, этапу или виду действия. Те же аннотации показывают затраты в токенах, времени, файловых и сетевых операциях без повторного разбора траекторий.

Чтобы получить устойчивые названия задач, AgentPProf рекурсивно делит траекторию в местах, где меняется ответственность агента. Каждый получившийся отрезок получает короткое имя с глаголом: например, deploy branches или diagnose authentication. Внутри крупного отрезка алгоритм снова ищет переходы, пока не получает связные подзадачи.

Метод исходит из того, что задача занимает непрерывный участок траектории, а её подзадачи образуют вложенные участки. Одинаковые цепочки имён затем объединяются между сеансами. Системные события наследуют метки действия, которое их вызвало; если связь неоднозначна, профилировщик оставляет событие непривязанным, а не угадывает родителя.

Результат экспортируется в формат pprof. На графике пламени ширина блока означает суммарный расход, а вложенность показывает, к какой задаче он относится. В примере с повторными попытками развернуть Git-сервис диагностика аутентификации потребляла 46% токенов, хотя составляла только 21% операций: команды выполнялись быстро, но их проверка снова обращалась к модели.

Профиль проверяли на группировке задач и поиске ошибок

В проверку вошли публичные наборы и реальные траектории агентов. Качество разбиения измеряли на 405 траекториях CodeTraceBench с размеченными людьми этапами, а поиск проблем — на трёх отдельных наборах. AgentPProf сравнивали со статистическим поиском повторяющихся действий, группировкой по исходным названиям операций и собственными средствами диагностики каждого набора.

На CodeTraceBench сегментация получила 0,764 по B3 F1 — метрике совпадения между предсказанными группами операций и человеческой разметкой. У сильнейшего автоматического варианта без такой сегментации результат составил 0,663. Ошибки чаще дробили одну задачу на несколько частей, чем объединяли несвязанные этапы, поэтому группы сохраняли смысловую однородность.

При поиске источника сбоя профиль дополнял исходный диагностический сигнал и статистически значимо улучшал ранжирование на каждом наборе. Он не заменял анализ конкретной операции, а помогал сначала выбрать подозрительную группу и только затем открывать её содержимое.

Профиль также привёл к практическому исправлению: повторяющаяся ошибка в синтаксисе идентификаторов вызова указала на границу слоя совместимости. Исправление одной строки сократило расход токенов модели на 19% без ухудшения качества выполнения задач по принятому в работе порогу.

Когда AgentPProf меняет план внедрения

Работа не предлагает заменять трассировку отдельных запусков. Если агент выполняет короткие или уникальные сценарии, обычного дерева событий достаточно. Семантический профиль полезен там, где накапливаются повторные траектории и нужно понять, какая задача систематически потребляет бюджет или порождает ошибки.

Для внедрения потребуется сохранять содержание шагов, временные отметки и складываемые показатели затрат. Идентификаторы инструментов и сеансов помогают связать уровни, но реализация умеет работать и без них. Логи Codex, Claude Code и записи AgentSight читаются локально, после чего утилита формирует стандартный профиль.

Главная дополнительная стоимость возникает при разметке границ задач с помощью модели. В эксперименте обработка всего корпуса CodeTraceBench заняла 37 минут, а построение нового представления по готовым отметкам — около одной секунды. Значит, сегментацию можно выполнять один раз, а затем быстро переключать метрики и способы группировки.

План разработки стоит менять не ради самого графика, а ради новой единицы анализа. Помимо идентификаторов сеанса и вызова инструмента, схема наблюдаемости должна сохранять связь между намерением агента и системным эффектом. Тогда расходы на модель, процессы, файлы и сеть можно отнести к одному этапу работы.

Перед использованием в управлении бюджетом нужен пилот на архивных траекториях. Команде следует проверить, складываются ли её сценарии из непрерывных подзадач и дают ли нормализованные названия устойчивые группы между запусками. Для параллельно переплетённых задач базовое допущение метода может не подойти без другой сегментации.

Источники

Иллюстрация: рисунок из статьи «AgentPProf: Semantic Profiler for Long Horizon AI Agents», Yusheng Zheng, Chaokun Chang, Yu Mao и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу