Журнал · Rit.work

SimSkill: как внешняя память помогает LLM-агенту осваивать SUMO

SimSkill накапливает проверенные процедуры и знания без дообучения LLM, но прирост зависит от базовой модели и сопровождается расходами на управление памятью.

Rit.work
Студия разработки
4 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Qi Liu, Qinzheng Wang и Yiming Bie представили SimSkill — агента для накопительного освоения транспортного симулятора SUMO; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, система улучшила результат с DeepSeek-V4-Pro и Qwen3.7-Max, но не дала прироста с GLM-5.2. Работа важна командам, которые строят агентов для повторяющихся инженерных задач и выбирают между дообучением модели и внешней памятью.

Что сделали

SimSkill не изменяет параметры базовой LLM. Вместо этого агент самостоятельно формирует учебные задачи в SUMO, выполняет их, проверяет результаты и сохраняет пригодный для повторного использования опыт. За примерно 80 часов автономной работы система собрала 150 процедурных навыков и набор связанных страниц с предметными знаниями.

Рабочий цикл начинается с поиска пробела в текущих возможностях. Агент предлагает задачу, которая должна расширить освоенную область: например, добавить новый способ построения сети, калибровки спроса или анализа результатов. После выполнения отдельный контур критики проверяет не только текстовый ответ, но и созданные файлы, запуск симуляции, соблюдение ограничений и соответствие рассчитанных показателей артефактам.

Память разделена по назначению. Эпизодическая сохраняет полные попытки и подтверждающие материалы. Процедурная содержит переносимые инструкции, код и другие исполняемые ресурсы. Семантическая хранит связанные между собой понятия и предметные сведения. У системы также есть операции поиска, объединения, обновления и проверки записей, чтобы память не оставалась архивом необработанных диалогов.

При новой задаче агент извлекает ограниченный набор подходящих процедур и знаний, адаптирует их к текущему запросу и снова проверяет исполнением. Таким образом, накопление возможностей происходит на уровне всей системы, а не внутри весов модели. Артефакты памяти можно просматривать, редактировать и переносить между совместимыми базовыми моделями.

Что показали

Авторы проверили SimSkill с тремя базовыми LLM и сравнили его с обычным запуском Claude Code без накопленной памяти. Для DeepSeek-V4-Pro доля подтверждённо выполненных заданий выросла на 10 процентных пунктов в первом тестовом наборе и на 20 пунктов во втором. Для Qwen3.7-Max прирост в первом наборе составил 25 пунктов, а во втором SimSkill выполнил две задачи против ни одной у базового варианта. GLM-5.2 не получил прироста по числу завершённых заданий.

Разбор компонентов показал, что процедурная и семантическая память дают отдельный вклад. Процедурная оказалась немного полезнее, однако полный вариант превосходил конфигурации только с одним типом памяти. Эффекты складывались, но авторы не обнаружили дополнительного усиления от их взаимодействия.

Память также не стала универсальным способом снизить расходы. Для одних сочетаний модели и тестового набора она сокращала бесполезный поиск решения, для других дополнительные извлечение, чтение и координация увеличивали стоимость и время. Продемонстрированный результат — расширение набора решаемых задач, а не гарантированная экономия на каждом запуске.

Ограничения

Эксперименты ограничены SUMO, двумя отложенными наборами по 40 заданий и тремя базовыми моделями. Работа не показывает, переносится ли накопленная память на другие симуляторы, инженерные системы или научные области. Авторы также не проверяли последовательные версии памяти повторными запусками, поэтому нельзя отделить устойчивый эффект обучения от вариативности отдельных прогонов.

Основное сравнение проведено с обычным Claude Code и внутренними вариантами SimSkill. Прямого экспериментального сопоставления с ChatSUMO, SUMO-MCP и другими специализированными агентами для транспортного моделирования в работе нет. Не измерены долговременное забывание, деградация качества при дальнейшем росте хранилища и расходы на обслуживание памяти за пределами описанного эксперимента.

Что это значит

Для команд, создающих агентов поверх симуляторов, средств разработки или аналитических платформ, работа меняет архитектурный план, но не выбор базовой модели сама по себе. Если задачи повторяются, результаты можно проверить исполнением, а решения состоят из комбинируемых процедур, внешняя память становится самостоятельным слоем продукта. В таком проекте нужно проектировать не только запросы к LLM, но и формат навыков, происхождение записей, проверку артефактов, поиск, слияние и удаление устаревшего знания.

SimSkill также показывает, почему сохранения истории диалогов недостаточно. Повторно использовать предлагается не весь журнал взаимодействия, а проверенные процедуры и структурированные предметные сведения. Это уменьшает количество нерелевантного контекста и делает накопленные возможности доступными для аудита.

Однако закладывать автоматическое обучение как способ снизить стоимость запросов рано: по замерам авторов результат зависит от модели и бюджета. Практический порядок внедрения — сначала создать набор воспроизводимых задач и независимую проверку результатов, затем сравнить агента без памяти с процедурной, семантической и полной конфигурациями. Без такого контура система может накапливать убедительно описанные, но неверные навыки.

Источники

Иллюстрация: рисунок из статьи «SimSkill: A Lifelong Learning AI Agent for Autonomous Mastery of Traffic Simulation», Qi Liu, Qinzheng Wang, Yiming Bie, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу