Журнал · Rit.work

Blueprint ищет обход защиты через состояние диалога

Авторы Blueprint показали, как связный сценарий и социальные приёмы распределяют вредоносный запрос по диалогу и обходят защиту LLM.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из Shanghai Qi Zhi Institute, Tsinghua University и Fangcun AI разработали Blueprint — среду для проверки многоходового обхода защиты LLM. В препринте, который не проходил рецензирование, авторы измерили среднюю долю успешных атак 79,2%. Работа важна командам, которые внедряют диалоговые модели в процессы с чувствительными данными или доступом к действиям.

Что сделали

Blueprint разделяет атаку на два управляемых слоя. Первый задаёт набор факторов социального влияния: ясность задачи, авторитет, легитимность, давление, обещание выгоды и другие способы сформулировать запрос. Поиск по их комбинациям на четырёх шагах выполняет метод Монте-Карло для деревьев — алгоритм, который пробует разные последовательности и чаще исследует перспективные ветви.

Второй слой, WorldviewSim, поддерживает состояние ситуации между репликами: роль запрашивающего, место действия, временную последовательность и обоснование задачи. Поэтому вредоносная цель появляется не как отдельная команда, а как продолжение уже сформированного контекста. Ответы проверяет модель-оценщик; полное выполнение запроса считается успехом.

По замерам авторов, Blueprint требовалось в среднем 2,46 обращения к целевой модели по выбранной траектории. Эта величина не включает обращения во время поиска стратегии. Разбор диалогов показал общий сценарий выхода из отказа: запрос постепенно превращался в конкретную исполнимую задачу, хотя сочетания социальных факторов различались между моделями.

Что это значит

Для защиты недостаточно проверять каждую реплику отдельно. Система должна учитывать состояние всего диалога: какие основания пользователь уже сформировал, как запрос стал конкретнее после отказа и не складываются ли нейтральные подзадачи в запрещённую цель. Это относится и к агентам, где ответ модели может запускать инструменты или менять данные.

Ограничения. Авторы получили поведенческие связи, но не доказали причинное влияние отдельных факторов. Проверка охватывала 80 сценариев HarmBench и шесть целевых моделей; генератор атак и модель-оценщик были зафиксированы на DeepSeek-V3.2. Набор факторов задан вручную, а сравниваемые методы запускались с собственными бюджетами и условиями. Работа также не показывает, сохраняются ли выявленные закономерности в естественных атаках, мультимодальных системах и диалогах с инструментами.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу