Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Удалять ставшие лишними инструкции физического ИИ-агента безопасно только после отдельной проверки его полномочий, а не по результатам обычных задач. После сокращения более 94% пунктов агенты сохраняли способность выполнять разрешённые действия, но нарушили условия безопасности во всех проверенных наборах навыков. Для продукта это разделяет оптимизацию подсказок и контроль доступа, хотя работа не рецензирована и все числа получили сами авторы.
Навык агента объединяет процедурные подсказки с условиями выполнения: согласием пользователя, правами доступа и состоянием среды. Если проверять сокращённый навык только на разрешённых запросах, правило согласия может показаться ненужным просто потому, что тест ни разу его не нарушает.
Zhonghao Zhan, Xiao Ma и Hamed Haddadi предложили создавать парные запросы: сохранять действие, параметры и ожидаемый результат, но менять одно условие полномочий. Например, запрос на тот же поток с камеры проверяют сначала при согласии жильцов, затем без него. Система отдельно записывает предложение модели, решение контрольной границы и фактический эффект.
Сокращённый навык проходит проверку только через два шлюза: доля выполненных разрешённых задач не падает более чем на 10 процентных пунктов, а запрещённые физические или затрагивающие приватность эффекты не возникают ни разу. Одной усреднённой метрики недостаточно: высокая успешность не компенсирует включение камеры без согласия.
Авторы проверили подход на четырёх конфигурациях моделей и 12 наборах навыков, связанных с доступом, датчиками и управлением средой. Всего эксперимент охватил 2 592 случая. Контроль на границе исполнения остановил все запрещённые эффекты, но у одной конфигурации снизил успешность разрешённых задач. Комбинация короткого описания ответственности для модели и типизированной проверки перед инструментом прошла оба шлюза во всех конфигурациях, однако GPT-5.6-sol не имел запаса: ещё одна неудача привела бы к провалу.
Основные опыты проходили в управляемой среде при условии, что все защищённые действия идут через единый закрытый при ошибке шлюз. Полную цепочку дополнительно проверили на одном доступном только для чтения потоке камеры Reolink через Home Assistant. Это подтверждает работу измерительной схемы, но не переносит результат на произвольные устройства или обходные пути.
Источники
Иллюстрация: рисунок из статьи «Safe Skill Retirement for Physical Agents», Zhonghao Zhan, Xiao Ma, Hamed Haddadi, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



