Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Долгоживущего агента научили решать, когда проверять внешний мир, а когда беречь лимит обращений для будущих задач. BudgetPM сохраняет 99,9–100% качества при сокращении числа проверок на 42–54%; это результат нерецензированного препринта, а все числа получили сами авторы. Для продуктов с фоновым мониторингом лимит API и инструментов можно распределять не по таймеру, а по ожидаемой пользе.
Агент может помнить намерение вроде «отправить заказ, когда поставщик подтвердит проверку», но для выполнения должен регулярно заходить во внешнюю систему. BudgetPM получает такие намерения от системы памяти, оценивает доступные проверки до обращения к источнику и соблюдает жёсткий лимит на шаг и весь эпизод.
Вариант BudgetPM-Static оценивает, улучшит ли конкретная проверка текущее решение. BudgetPM-Sequential дополнительно учится на расписаниях, которые построили офлайн с учётом всего эпизода. Во время работы будущие события ему недоступны: политика видит только оставшийся бюджет, ход эпизода, историю обращений и другие данные, известные до запроса.
При достаточном лимите локальной оценки оказалось достаточно. Когда текущие и будущие проверки начали конкурировать, последовательная политика обошла лучшее из проверенных расписаний с фиксированной логикой на 1,92–2,58 пункта по Set F1 — метрике качества набора сработавших намерений. То же качество и долю вовремя замеченных событий она получила с числом обращений на 16–33% меньше.
Метод проверяли на PM-Bench с семидневными потоками событий и на задачах GoodAI LTM. Полное сравнение охватило Llama-3-8B, Qwen2.5-14B и Qwen3-14B, адаптированные процессы Mem0 и PMA, а также несколько правил периодической проверки и отсрочки. В отдельных опытах стоимостью считали обращения к часам, каналам состояния или семантическому проверяющему модулю, поэтому вывод относится прежде всего к агентам с повторяющимися дискретными запросами.
Практическое правило зависит не от номинального лимита, а от соотношения спроса и доступных проверок. Если ёмкости хватает, можно оценивать пользу каждого запроса отдельно. Если лимит заканчивается раньше потока задач, политике нужно учитывать будущие возможности и сознательно оставлять запас.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



