Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Автономных операторов научились проверять на непрерывном управлении интернет-магазином, где спрос, поставщики и конкуренты меняются без команды агента. В препринте Daksh Raghuvanshi, Ved Vedere и Yifan Wang, который не проходил рецензирование и где все числа получены авторами, лучший результат DeepSeek-V4-Pro составил 49% пройденных проверок против 97% у эвристического оператора. Для продуктовых команд StoreBench предлагает оценивать не отдельные ответы модели, а её способность месяцами поддерживать работающий процесс.
Магазин продолжает жить, пока агент принимает решения
StoreBench помещает агента в синтетический магазин одежды Ostrelle, который работает на Medusa v2 — серийной платформе электронной торговли. Покупатели оформляют и возвращают заказы, поставщики меняют цены и задерживают поставки, конкуренты перехватывают спрос, а часть событий приходит без предупреждения.
Агент видит магазин только через 29 административных инструментов. Они позволяют читать отчёты, менять цены, закупать товары, отправлять заказы и оформлять возвраты. Прямого доступа к скрытой модели спроса или будущим событиям нет.
Каждый вызов инструмента расходует одну операцию. Мир движется интервалами по 12 часов, когда агент исчерпывает доступные действия или сам завершает интервал. Поэтому медленная модель не проигрывает только из-за задержки ответа, но лишний отчёт действительно конкурирует за ресурс с отправкой заказа или возвратом денег.
Такой счётчик отделяет качество решений от скорости API и одновременно проверяет расстановку приоритетов. Агенту недостаточно составить правильный план: он должен успеть выполнить рутинные действия, не потерять обязательства при сокращении контекста и продолжить работу после изменения рынка.
Прибыль не скрывает сорванные заказы
Итоговая оценка сочетает экономический результат, надёжность обслуживания и непрерывность работы. Прибыльный магазин получает штраф, если поздно отправляет заказы, игнорирует возвраты или прекращает работу до конца эпизода. После завершения симулятор также учитывает обязательства, которые агент не успел закрыть.
Проходной балл не задают произвольно. Для каждого сценария запускают несколько запрограммированных политик: от бездействия и механической обработки всех заказов до оператора smart-triage, который расставляет приоритеты по эвристическим правилам. Порог располагают между сильнейшими честными политиками, поэтому он отражает измеренное качество работы, а не выбранную авторами красивую границу.
Отдельная политика пытается использовать ошибки симулятора и системы оценки. Найденные способы получить незаслуженную награду закрывают и добавляют в регрессионные проверки. Один и тот же ряд действий воспроизводит тот же журнал операций, что позволяет разобрать провал до конкретного решения, а не только сравнить конечные баллы.
Проверка охватывает семь передовых моделей, одиннадцать сценариев и три варианта случайных событий. Сценарии идут примерно от месяца работы до отдельного годового прогона. Это один синтетический магазин одежды со сценарными конкурентами и параметрической моделью спроса, поэтому результаты не описывают всю автоматизацию торговли или других отраслей.
Люди с опытом электронной торговли работали через те же инструменты и в среднем обошли все модели. Разрыв возник прежде всего в исполнении: люди стабильнее отправляли заказы и проводили возвраты, хотя лучший агент показывал немного более сильный экономический результат. Значит, слабое место лежит не только в коммерческой стратегии, но и в способности долго выполнять обычные обязанности без пропусков.
Планы меняет метод проверки, а не таблица моделей
StoreBench пока не даёт основания выбрать модель для промышленного магазина по месту в рейтинге. Короткие сценарии запускали через goose, а годовой — через Claude Code с другим режимом рассуждения и сжатием контекста. На длинном прогоне большинство моделей работало лучше, но отделить влияние длительности от влияния агентной обвязки по этому эксперименту нельзя.
Для команды, которая строит оператора, отсюда следует практическое изменение плана испытаний: модель и обвязку нужно проверять вместе. В стенде стоит воспроизвести поток внешних событий, ограничить число операций, сохранить полный журнал и добавить простые эталонные политики. Иначе высокая оценка может означать лишь то, что модель хорошо прошла статичную задачу с удобным интерфейсом.
Эксперимент с дообучением показывает, для чего такой стенд можно использовать. После обучения Qwen3.5-27B на пяти отдельных задачах средняя оценка на отложенных сценариях выросла с 0,136 до 0,373. Улучшение пришло главным образом из операционной дисциплины: агент чаще вовремя отправлял товары, обрабатывал возвраты и дольше оставался в процессе, но почти не научился лучше управлять ценами и запасами.
Это разделяет две задачи, которые легко смешать в проекте. Сначала агенту можно привить устойчивое исполнение повторяющихся процедур, а затем отдельно учить экономическим решениям под неопределённостью. Для первой задачи нужны проверяемые действия и частая обратная связь; для второй — сценарии, где цены, спрос и доступность товаров меняют выгоду каждого решения.
Полный симулятор и набор оценочных сценариев не входят в опубликованные материалы: доступны примеры задач, траектории и инструменты пересчёта оценки. Поэтому StoreBench полезнее как образец архитектуры внутреннего испытательного стенда, чем как внешний рейтинг, который можно прямо встроить в выбор поставщика модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



