Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Kelvin Li и соавторы из University of California, Berkeley, MIT-IBM Watson AI Lab, Cal Poly San Luis Obispo и Xero представили модель мира для веб-агентов в препринте, который не проходил рецензирования. В сквозном тесте агент с прогнозами состояний успешнее выполнял задания, чем агент, который выбирал из нескольких действий без таких прогнозов. Работа важна командам, которые строят браузерных агентов с генерацией и последующим ранжированием кандидатов.
Что сделали
Модель мира — это компонент, который по текущей странице и предполагаемому действию прогнозирует следующее состояние среды. Веб-агент может сгенерировать несколько действий, получить прогноз для каждого и перед выполнением выбрать наиболее подходящее.
Обычно такую модель учат воспроизводить заранее выбранное представление следующего состояния: текстовое описание изменений, HTML или дерево доступности AXTree. Авторы считают эту цель недостаточно связанной с последующим выбором действия. Полный снимок страницы содержит много неизменившейся структуры, а краткое описание может пропустить небольшое, но существенное различие между исходами.
Предложенная цель обучения называется сопоставлением прогнозируемого состояния (predicted-state matching). Модель получает текущее состояние и одно действие, после чего формирует свободное текстовое описание ожидаемого результата. Модель-оценщик должна по этому описанию отличить фактическое следующее состояние от состояния, к которому привело другое действие из той же исходной точки.
Оценщику не показывают исходную страницу, историю, инструкцию и проверяемое действие. Поэтому модель мира не может полагаться на пересказ входных данных: её описание должно содержать признаки, позволяющие различить именно результаты действий. Для обучения использовали Qwen3-32B как модель-оценщик, а корректность дополнительно проверяли с другими моделями.
Данные авторы получили из линейных траекторий Go-Browse в средах WebArena. Повторяющиеся состояния браузера объединили в граф: если из одного состояния в разных траекториях выполнялись разные действия, возникала точка ветвления с несколькими наблюдаемыми исходами. После обучения прогнозы передавали модели вознаграждения процесса (PRM) — компоненту, который оценивает кандидатов на каждом шаге, — либо замороженной модели-ранжировщику.
Что показали
Авторы проверили подход на трёх уровнях: непосредственное сопоставление прогнозов с состояниями, ранжирование действий на WebPRMBench и выполнение полных заданий на WebArena-Lite.
В сквозном эксперименте GPT-4o, выбирающий одно действие в стиле ReAct, выполнил 13,94% заданий. Генерация и ранжирование нескольких кандидатов подняли результат до 21,82%. Добавление прогнозов предложенной модели мира довело успешность до 28,48%. Это показывает полезность представления не только на внутреннем тесте авторов, но и в цепочке, где агент действительно выполняет действия.
Эффект сохранился без дополнительного обучения ранжировщика. Для замороженного Qwen2.5-7B средняя точность выбора лучшего кандидата из набора на WebPRMBench выросла с 42,78% без прогнозируемого состояния до 54,65% с ним. В тех же условиях представления авторов также превосходили состояния, сгенерированные WebWorld-8B.
По интерпретации авторов, преимущество связано не с полнотой восстановления страницы, а с сохранением различий, важных для выбора действия. Вывод согласуется между внутренним сопоставлением состояний, ранжированием и сквозным тестом, но все три проверки остаются частью одной работы.
Ограничения
Обучающая выборка содержит 7 730 точек ветвления из 2 839 траекторий Go-Browse, преобразованных в 30 920 пар для сопоставления. Она охватывает наблюдавшиеся действия, но не все возможные переходы из каждого состояния. Поэтому модель училась различать доступные в траекториях ветви, а не строить исчерпывающую модель поведения сайта.
Сквозная проверка ограничена WebArena-Lite и GPT-4o в роли основной модели агента. Работа не показывает, сохранится ли выигрыш на живых сайтах, с другими моделями политик или в процессах, где страницы и данные меняются независимо от агента. Сопоставление состояний остаётся косвенной метрикой на основе моделей-оценщиков и может наследовать общие для них ошибки.
В сквозном сравнении авторы сопоставили три режима внутри собственного программного контура, но не провели аналогичный тест с несколькими основными моделями агента. В работе также нет замеров задержки и стоимости: для каждого шага требуется сгенерировать несколько действий, отдельно спрогнозировать их исходы и затем выполнить ранжирование.
Что это значит
Для команд, уже использующих модель мира при выборе действий, работа предлагает изменить прежде всего цель обучения. Воспроизведение HTML или AXTree не следует считать достаточным критерием качества. Полезнее проверять, позволяет ли прогноз отличить последствия одного допустимого действия от последствий другого в той же точке процесса.
Это влияет и на сбор данных. Линейных журналов успешных прохождений недостаточно: нужны повторные состояния с альтернативными выполненными действиями и зафиксированными результатами. Такой набор можно использовать как для обучения, так и для проверки того, помогает ли описание исхода ранжировщику.
Планы стоит менять на уровне эксперимента, а не архитектуры продукта целиком. Если агент уже генерирует несколько кандидатов и ошибки часто возникают при выборе между внешне правдоподобными действиями, сопоставление состояний даёт обоснованное направление для прототипа. Для реактивного агента, который сразу выполняет одно действие, сначала придётся добавить генерацию кандидатов, модель мира и ранжирование; без замеров задержки и стоимости работа не позволяет решить, оправдан ли этот контур в производственной системе.
Источники
Иллюстрация: рисунок из статьи «Discriminative World Models for Web Agents», Kelvin Li, Dhruv Pendharkar, Anish Pahilajani и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



