Журнал · Rit.work

APEx превращает историю исследовательского агента в процедурные навыки

APEx хранит опыт исследовательского агента как конкретные траектории и общие навыки, а затем использует их для адаптации планировщика во время поиска.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Jie Ding и соавторы из University of Science and Technology of China, ByteDance и Chinese Academy of Sciences представили APEx для накопления и повторного использования опыта исследовательских агентов; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, APEx опередил сильнейшую систему с памятью на 3,0 пункта по среднему результату. Подход важен командам, которые строят агентов для повторяющихся исследовательских задач и хотят улучшать стратегию поиска на прошлых запусках.

Что сделали

APEx разделяет опыт на два слоя. Первый хранит траектории отдельных задач: запрос, краткое описание процесса, ответ и результат выполнения. Второй объединяет похожие траектории в процедурные навыки: рекомендуемые шаги, типовые ошибки и оценку успешности.

Система замыкает эти слои в цикл из планировщика, исполнителя и дистиллятора. Исполнитель работает с поисковыми инструментами, дистиллятор обновляет навыки, а планировщик использует и общую инструкцию, и подходящие примеры. Модули поочерёдно обучают с подкреплением методом GRPO, который сравнивает несколько вариантов ответа внутри одной группы.

Во время применения планировщик дополнительно обновляется на запросах без эталонных ответов. Награду формируют несколько моделей-оценщиков, а соответствие накопленному навыку ограничивает отклонение стратегии. Средний результат APEx на семи наборах задач составил 64,4%. Удаление траекторий снизило результат на 1,8 пункта, а удаление навыков — на 3,1 пункта: по этим замерам обобщённая процедура дала больший вклад, но оба слоя дополняли друг друга.

Что это значит

APEx предлагает хранить не полный журнал агента, а сочетание конкретных примеров и обновляемого регламента. Такая схема подходит продуктам с повторяющимися классами запросов: навыки сокращают необходимость каждый раз извлекать длинные истории, а траектории сохраняют детали для нетипичных случаев. Однако внедрение потребует отдельного контура обучения и безопасного обновления параметров во время работы.

Ограничения. Авторы проверяли систему на семи вопросно-ответных наборах с текстом и изображениями; исполнитель основан на Qwen2.5-VL-7B, а планировщик и дистиллятор — на Qwen3-8B. Обучение использовало FVQA и MATPO, поэтому работа не показывает масштабирование на более крупные базовые модели и другие экосистемы инструментов. Сравнение с GPT-5.4 не изолирует вклад памяти и обучения: закрытая модель отвечала без агентного процесса, тогда как APEx использовал поиск, накопленный опыт и адаптацию во время выполнения. Также авторы не сравнили поэтапное обучение с совместным сквозным обучением модулей.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу