Журнал · Rit.work

Из LoRA-адаптера удалили скрытую закладку без повторного обучения

Проекция изменений весов снизила долю успешных атак на LoRA-адаптеры с почти 100% до менее 10%, не требуя знания триггера или повторного обучения подозрительного адаптера.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LoRA-адаптер можно очистить от скрытой закладки без знания её триггера и без повторного обучения самого адаптера. Хотя препринт не рецензирован и числа получили сами авторы, Jianwei Li и Jung-Eun Kim из North Carolina State University снизили долю успешных атак с почти 100% до менее 10%. Метод позволяет проверять сторонние адаптеры перед подключением к базовой модели, не имея исходной обучающей выборки или чистого адаптера для сравнения.

Закладка заставляет модель выдавать заданный результат, когда во входных данных появляется скрытый шаблон. Метод исходит из того, что в LoRA такая связь занимает небольшое число направлений среди изменений весов. Чтобы найти их, команда обучает на той же базовой модели несколько искусственно заражённых адаптеров с другими сочетаниями триггеров и вредного поведения, а затем выделяет общие для них направления.

После этого подозрительный адаптер проецируют на ортогональное дополнение (null space): из изменений весов убирают компоненты, совпадающие с найденными направлениями. Можно удалить их полностью или частично, если они пересекаются с полезными навыками адаптера. Вспомогательные адаптеры всё же приходится обучать, но подозрительный адаптер не дообучают; для распространённой базовой модели набор направлений можно рассчитать заранее и применять при проверке новых адаптеров.

Подход проверяли на LLaMA2-7B-Chat, LLaMA2-13B-Chat, Mistral-7B-Instruct, Qwen2-7B-Instruct и двух версиях CodeLLaMA. Испытания охватили целевой отказ, управление тональностью и внедрение кода, а также пять способов атаки. В контролируемом опыте с одним слоем доля успешных атак упала с 82% до 1%; против адаптивной атаки с согласованным рангом — со 100% до 0,5%.

Граница метода проходит по структуре LoRA: он рассчитан на закладки, которые занимают компактное подпространство изменений весов. При ранге от 32, переносе между задачами и атакующем, который специально размывает вредные направления, очистка работает хуже. Поэтому проекцию пока стоит рассматривать как дополнительную проверку адаптера, а не как доказательство его безопасности.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу