Журнал · Rit.work

Отказ LLM может выдать, какие промпты она «забыла»

TAS восстанавливает промпты, подавленные методами машинного забывания, по характерным отказам модели при доступе только через текстовый API.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из University of Warwick и University of Cambridge предложили атаку TAS на машинное забывание — дообучение, которое должно подавить выбранные данные; работа опубликована как препринт, не прошедший рецензирования. По замерам авторов, атака реконструирует до 95% забытых промптов, даже если их содержание заранее неизвестно. Результат важен для команд, которые рассчитывают с помощью машинного забывания удалить из LLM персональные, конфиденциальные или нежелательные сведения.

Что сделали

TAS работает с моделью как с чёрным ящиком: отправляет запросы через обычный текстовый интерфейс и видит только ответы. Из сохранённых промптов, которые заведомо не относятся к удаляемому набору, атака выделяет сущности и повторно используемые шаблоны вопросов. Затем она подставляет сущности в шаблоны и оценивает ответы по признакам отказа — характерным формулировкам и смысловой близости к эталонным отказам.

Вместо полного перебора TAS адаптивно направляет запросы к сочетаниям, которые чаще вызывают необычное поведение. После обнаружения вероятной сущности атака повторно подставляет её в шаблоны и ранжирует получившиеся промпты по силе отказа. Авторы проверили подход на Llama2-7B, Llama3-8B и Gemma-7B с методами DPO, NPO и LUNAR, используя PISTOL, DUSK и TOFU. В лучшем случае TAS потребовалось на 99,7% меньше запросов, чем полному перебору.

Что это значит

Подавление ответа и сокрытие цели удаления оказываются разными свойствами. Если дообученная модель отказывается отвечать на конкретные сочетания сущностей иначе, чем на обычные запросы, сам отказ становится побочным каналом утечки. Поэтому при проверке машинного забывания недостаточно выяснить, воспроизводит ли модель удалённый ответ: нужно также проверять, можно ли по её поведению определить, какие сведения пытались подавить.

Ограничения. TAS предполагает, что сохранённые промпты содержат сущности и структуру, достаточные для построения пространства поиска. Эксперименты охватывают по три модели, метода забывания и набора данных, причём атака рассчитана на методы с различимым следом в сгенерированном тексте. При большем и заранее неизвестном числе забытых сущностей авторский способ определить их количество работает менее надёжно. Сравнение показывает преимущество над полным перебором и другими стратегиями поиска, но предложенные в работе варианты защиты авторы не реализовывали и не оценивали.

Источники

Иллюстрация: рисунок из статьи «Extracting Forgotten Prompts from Targeted Unlearned Models», Au Ashley Hoi-Ting, Meghdad Kurmanji, William F. Shen и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу