Журнал · Rit.work

Почему послойное ограничение обновлений ломает приватное обучение речевых LLM

Разделение бюджета приватности между аудиоэнкодером и языковой частью помогает обучать речевые LLM, когда масштабы их обновлений различаются на порядок.

Rit.work
Студия разработки
11 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Обычная настройка приватного федеративного обучения может сорвать обучение речевой LLM, если её аудиоэнкодер и языковая часть обновляются в разных масштабах. В работе Telefónica, которая не рецензирована и содержит замеры самих авторов, раздельный бюджет усилил защиту обновлений энкодера в 4,47 раза и сохранил качество распознавания близким к базовому методу. Перед выбором схемы достаточно измерить нормы обновлений компонентов: разделять их нужно не во всех архитектурах.

Общий бюджет сталкивает энкодер с языковой моделью

При федеративном обучении данные остаются у клиентов, а сервер собирает рассчитанные ими обновления модели. Дифференциальная приватность ограничивает влияние отдельного клиента: его обновление обрезают до заданной нормы, после чего сервер добавляет к сумме гауссов шум.

Плоская схема применяет один порог ко всему обновлению. Послойная схема делит этот бюджет между матрицами, обычно пропорционально числу параметров. Для однородной модели такой подход точнее сохраняет градиент, но речевая LLM состоит из неодинаковых частей: аудиоэнкодера, связующего проектора и языкового декодера.

В изученных связках Whisper с TinyLlama или EuroLLM обновления матриц языковой части были примерно на порядок крупнее обновлений энкодера. При этом энкодер содержал основную долю обучаемых параметров LoRA. Распределение по размеру отдавало ему значительную часть общего бюджета, хотя его отдельные обновления уже находились рядом с уровнем добавляемого шума.

Языковая часть из-за этого слишком часто упиралась в свой послойный порог, а сигнал энкодера оставался слабым относительно шума. Адаптация бюджета по скользящему среднему не успевала исправить перекос в начальных раундах: обучение либо заметно теряло точность, либо практически разрушалось.

Авторы проверили шесть способов распределения бюджета на трёх архитектурах. Все эксперименты использовали многоязычный корпус MLS с разделением клиентов по говорящим; модель угроз предполагала доверенный сервер агрегации и защищала выпущенные версии модели от внешнего наблюдателя.

Два пула сохраняют общую гарантию приватности

Метод α-split сначала разделяет обновление на два пула. В первый входят параметры аудиоэнкодера, во второй — языковая модель и связующий проектор. Внутри каждого пула бюджет по-прежнему распределяется между матрицами пропорционально их размеру.

Параметр α задаёт долю квадрата общего порога, которая достаётся энкодеру. Для Whisper с TinyLlama выбрали α = 0,05: этого хватило, чтобы не обрезать большую часть стабилизировавшихся обновлений энкодера, а допустимый шум языковой части вырос лишь на 2,6%.

Квадраты порогов двух пулов в сумме равны квадрату исходного общего порога. Поэтому чувствительность всего обновления не меняется, сервер добавляет шум прежнего масштаба, а общая гарантия дифференциальной приватности остаётся той же.

Меняется защита отдельных компонентов. Энкодер получает меньший собственный предел обновления при том же серверном шуме. Это усложняет восстановление по градиентам акустических признаков, связанных с голосом, акцентом и просодией, не заставляя языковую часть платить сопоставимым ростом шума.

Разделение нужно только при сильном перекосе

На Whisper с TinyLlama α-split отстал от плоского ограничения всего на 0,27 процентного пункта по доле ошибок в словах — метрике, которая учитывает замены, пропуски и лишние слова. Остальные послойные методы при размороженном энкодере потеряли больше качества.

На Whisper с EuroLLM разделение улучшило результат адаптивной послойной схемы на 2,45 процентного пункта. Это показывает, что сбой связан не с конкретным языковым декодером, а с конкуренцией компонентов за единый бюджет.

Для Voxtral-Mini-3B вывод оказался другим. Отношение норм обновлений языковой части и энкодера составляло около 1,7 раза, тогда как в связках с Whisper оно доходило примерно до 12 раз. При умеренном перекосе лучший приватный результат дала адаптивная схема с одним пулом, а фиксированное разделение слишком сильно обрезало энкодер.

Работа меняет планы команд не выбором нового метода по умолчанию, а обязательной диагностикой перед приватным обучением. Стоит провести несколько подготовительных раундов на допустимом наборе данных, измерить нормы обновлений отдельно для энкодера и декодера и лишь затем выбирать схему. При близких масштабах безопаснее оставить адаптивный общий пул; при разнице на порядок компонентам нужны независимые пределы.

Вывод относится к федеративной настройке речевых LLM с LoRA, центральной дифференциальной приватностью и проверенными архитектурами на MLS. Он не устанавливает универсальную границу для других моделей, но даёт измеримый признак, который можно проверить до основного запуска.

Источники

Иллюстрация: рисунок из статьи «Component-Aware Differential Privacy for Federated Multilingual Speech-LLMs», Jordi Luque, Fernando L\'opez, Aleix Sant, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу