Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из Shanghai Qi Zhi Institute, Tsinghua University и Fangcun AI разработали Blueprint — среду для проверки многоходового обхода защиты LLM. В препринте, который не проходил рецензирование, авторы измерили среднюю долю успешных атак 79,2%. Работа важна командам, которые внедряют диалоговые модели в процессы с чувствительными данными или доступом к действиям.
Что сделали
Blueprint разделяет атаку на два управляемых слоя. Первый задаёт набор факторов социального влияния: ясность задачи, авторитет, легитимность, давление, обещание выгоды и другие способы сформулировать запрос. Поиск по их комбинациям на четырёх шагах выполняет метод Монте-Карло для деревьев — алгоритм, который пробует разные последовательности и чаще исследует перспективные ветви.
Второй слой, WorldviewSim, поддерживает состояние ситуации между репликами: роль запрашивающего, место действия, временную последовательность и обоснование задачи. Поэтому вредоносная цель появляется не как отдельная команда, а как продолжение уже сформированного контекста. Ответы проверяет модель-оценщик; полное выполнение запроса считается успехом.
По замерам авторов, Blueprint требовалось в среднем 2,46 обращения к целевой модели по выбранной траектории. Эта величина не включает обращения во время поиска стратегии. Разбор диалогов показал общий сценарий выхода из отказа: запрос постепенно превращался в конкретную исполнимую задачу, хотя сочетания социальных факторов различались между моделями.
Что это значит
Для защиты недостаточно проверять каждую реплику отдельно. Система должна учитывать состояние всего диалога: какие основания пользователь уже сформировал, как запрос стал конкретнее после отказа и не складываются ли нейтральные подзадачи в запрещённую цель. Это относится и к агентам, где ответ модели может запускать инструменты или менять данные.
Ограничения. Авторы получили поведенческие связи, но не доказали причинное влияние отдельных факторов. Проверка охватывала 80 сценариев HarmBench и шесть целевых моделей; генератор атак и модель-оценщик были зафиксированы на DeepSeek-V3.2. Набор факторов задан вручную, а сравниваемые методы запускались с собственными бюджетами и условиями. Работа также не показывает, сохраняются ли выявленные закономерности в естественных атаках, мультимодальных системах и диалогах с инструментами.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



