Журнал · Rit.work

Компьютерного агента обучили трём реакциям на риск

SCOPE учит компьютерного агента выполнять обычные задачи, обходить опасные элементы интерфейса и отказываться, когда безопасного пути нет.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Компьютерного агента научили различать обычную задачу, опасный путь к допустимой цели и запрос, который нельзя выполнять. В нерецензированном препринте команда Zeyu Kang приводит собственные замеры: итоговая модель показала лучший баланс качества и безопасности среди проверенных агентов. Для разработки таких систем это меняет схему дообучения: примеров успешного выполнения и отказов недостаточно без отдельных безопасных продолжений.

Авторы создали SCOPE-Gen — конвейер для синтеза проверяемых задач в графическом интерфейсе. Для обычной задачи он готовит начальное состояние, программную проверку результата, правильный итог и правдоподобные ошибочные варианты. Затем в ту же среду добавляет риск — например, поддельную страницу или вредоносную инструкцию в документе, — но сохраняет исходную цель и способ проверки. Опасные действия отслеживаются на каждом шаге, поэтому агент не получает зачёт, если сначала попался на атаку, а потом исправил конечное состояние.

В обучение смешали три вида траекторий: выполнение обычных задач, продолжение по безопасному пути и явный отказ. Сначала Qwen3.5-9B дообучили на готовых примерах, затем улучшили выполнение задач через обучение с подкреплением. В набор вошла всего 81 вручную отобранная траектория отказа; они задавали границу, после которой агент должен остановиться.

SCOPE-RL успешно выполнил 54,17% задач OSWorld и избежал атак в 64,30% случаев на OS-BLIND. При удалении траекторий отказа второй показатель упал с 66,30% до 13,00%. При этом замена безопасных продолжений дополнительными отказами ухудшила выполнение обычных задач: агент чаще останавливался вместо того, чтобы обойти риск.

Проверка охватывает одну базовую модель и две настольные среды. OSWorld измеряет завершение задач в приложениях, а OS-BLIND — уклонение от атак при безобидной цели пользователя; последняя метрика не различает разумный отказ и безопасное продолжение. Поэтому работа показывает полезную схему подготовки данных, но не подтверждает, что такой баланс сохранится на других моделях и интерфейсах.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу