Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Скрытую закладку (backdoor) в LLM научились направлять в отдельный модуль, чтобы затем отключить её одним изменением веса. В нерецензированном препринте команда North Carolina State University, которая сама получила все приведённые числа, снизила долю успешных атак со 100% до 0–10% в большинстве сценариев. Такой подход убирает постоянный фильтр запросов из продакшена, но требует заложить защиту ещё при дообучении.
Метод QES добавляет к выбранным слоям модели несколько LoRA-ветвей и маршрутизатор, который выбирает ветвь для каждого токена. Во время обучения механизм внимания отмечает фрагменты запроса, связанные с подозрительным поведением, и направляет их в карантинный экспертный модуль. Обычные токены распределяются между остальными ветвями, при этом QES не отбрасывает примеры и не требует заранее знать точный триггер закладки.
Перед развёртыванием вес карантинного модуля обнуляют. Модель продолжает выполнять тот же проход без отдельной проверки каждого запроса, повторного обучения или исправления весов после обучения. На Qwen2-7B-Instruct с атакой BadNets доля успешных атак упала до 1,5%, а результат на GSM8K снизился на 1,14 процентного пункта. Отключение одной из обычных ветвей, напротив, не мешало атаке, но отнимало 22,4 пункта на GSM8K: вредоносное и полезное поведение действительно разошлись по разным маршрутам.
QES проверяли на четырёх семействах моделей, двух задачах и трёх типах атак. Метод хуже справлялся с триггерами, которые внимание не могло выделить среди обычного содержимого: например, последовательности цифр терялись на фоне математических данных. В работе также отмечена уязвимость к адаптивным атакам и скрытым синтаксическим триггерам, поэтому QES пока стоит рассматривать как способ удешевить отключение уже локализованной закладки, а не как универсальную защиту.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



