Журнал · Rit.work

Разреженное внимание создало побочный канал в общей GPU

SparLeak определяет свойства запросов и восстанавливает ответы LLM по обращениям к памяти общей GPU, превращая ускорение вывода в риск утечки данных.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Соседний процесс на общей GPU смог определить свойства пользовательского запроса и восстановить ответ LLM, не обращаясь к её API. В препринте, который не прошёл рецензирование, команда Shandong University, Xi’an Jiaotong University и Waseda University приводит собственные замеры: свойства запросов удалось определить с точностью 90,9%. Значит, при совместном использовании ускорителя граница между арендаторами может проходить недостаточно глубоко.

Разреженное внимание (sparse attention) ускоряет обработку длинного контекста: модель обращается не ко всем токенам, а только к выбранным как значимые. Состав этих токенов зависит от запроса и ответа, поэтому меняются обращения к страницам памяти с KV-кэшем. SparLeak косвенно считывает их через конкуренцию за кэш второго уровня и механизм трансляции виртуальных адресов, а затем восстанавливает приблизительный профиль обращений для отдельных токенов.

На этапе обработки запроса этот профиль выдаёт его смысловые свойства, например категорию заболевания. Во время генерации пошаговые следы позволяют восстанавливать токены ответа; средняя доля успешных восстановлений составила 87,3%. Атаку проверяли на LongChat-7B, LLaMA3-8B и Qwen3-8B, трёх механизмах разреженного внимания и трёх наборах чувствительных данных. Сценарий требует, чтобы атакующий процесс работал на той же физической GPU, а перед атакой собрал обучающие следы на копии конфигурации либо через выбранные запросы к цели.

Практическая защита — не размещать недоверенных арендаторов на одной GPU либо разделять между ними кэш и трансляцию адресов на уровне среды выполнения или оборудования. Случайная замена выбранных токенов ослабляет утечку, но портит результат: при замене 30% токенов оценка совпадения текста ROUGE у LLaMA3-8B упала с 0,48 до 0,16. Фиксированные схемы обращений и фиктивные чтения KV-кэша тоже скрывают зависимость от входа, но сокращают выигрыш от разреженного внимания.

Источники

Иллюстрация: рисунок из статьи «SparLeak: Privacy Leakage from Sparse Attention in LLM Inference on Shared GPUs», Fahao Chen, Linkang Du, Jinhao Zhou и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу