Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Появился способ проверять долгоживущих LLM-агентов на редкие ошибки памяти, которые скрывает средний балл. В препринте Jianhua Jiang, Dongbo Yuan и Weihua Li, который не прошёл рецензирование и содержит замеры самих авторов, набор из 20% заданий почти сохранил порядок моделей и все категории риска. Такой сокращённый тест подходит для частых проверок агента во время разработки, если полный прогон требует слишком много вычислений.
MemRiskBench проверяет устаревшие факты, неверный выбор между конфликтующими записями, утечку данных между пользователями, повторное использование отозванной памяти и постепенную потерю ограничений. Система оценивает текст ответа, вызовы инструментов, состояние памяти и действующие запреты по заранее заданным правилам, поэтому итоговый зачёт не зависит от модели-оценщика.
Для сокращения бенчмарка алгоритм выбирает эпизоды, на которых модели различаются сильнее, но требует сохранить каждую категорию риска и модели с худшими результатами. Коэффициент ранговой корреляции Спирмена составил 0,975: порядок моделей почти совпал с результатом полного прогона. Обычная случайная или равномерная выборка по категориям чаще теряла опасные сбои, даже когда охватывала все типы риска.
Проверка охватила 120 сценарных эпизодов и пять локально запущенных квантованных моделей размером менее 8 млрд параметров. Инструменты были программными заглушками, а три модели относились к семейству Qwen, поэтому результат пока не переносится напрямую на API-модели и реальные браузеры или почтовые клиенты.
Сокращённый набор также зависит от моделей, по которым алгоритм определял различающие задания. Если команда добавляет другую архитектуру или заметно меняет агента, выборку придётся пересобрать на собственных результатах. Поэтому MemRiskBench скорее задаёт воспроизводимый процесс проверки памяти, чем предлагает неизменный универсальный набор коротких тестов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



