Журнал · Rit.work

SEAL закрепляет защиту MoE в общих экспертах

Авторы SEAL предлагают дополнять защиту маршрутизатора MoE адаптером в общих экспертах, которые обрабатывают каждый токен.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи Vrije Universiteit Amsterdam разработали SEAL — способ усиливать безопасность моделей типа «смесь экспертов» (MoE) через всегда активные общие эксперты; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, метод снижает долю успешных атак до 60%. Подход важен командам, которые выбирают открытую гибридную MoE-модель для продукта и планируют дообучать или развёртывать её самостоятельно.

Что сделали

В гибридной MoE-модели маршрутизатор выбирает для каждого токена лишь часть специализированных экспертов. Поэтому защита, записанная в них или в самом маршрутизаторе, зависит от выбранного пути и может ослабнуть после вредоносного запроса, дообучения либо удаления критичных нейронов. Общие эксперты, напротив, участвуют в обработке каждого токена независимо от маршрутизации.

SEAL добавляет к проекциям общих экспертов LoRA-адаптеры и обучает их методом прямой оптимизации предпочтений (DPO) на безопасных и небезопасных ответах. Изменяется не более 0,25% параметров модели, тогда как маршрутизатор и специализированные эксперты остаются замороженными. Вариант SEAL++ дополнительно ограничивает обновления, чтобы обучение не перезаписало уже существующие направления параметров, связанные с безопасным поведением.

Авторы проверили защиту на сочетаниях вредоносных запросов, обхода ограничений, злонамеренного дообучения и удаления нейронов. Среднее изменение качества на пяти тестах общих возможностей не превысило 1,4%.

Что это значит

SEAL предлагает не замену защите маршрутизатора, а второй независимый слой: даже при изменившемся пути токена защитный адаптер продолжает работать. Для собственной инфраструктуры это означает возможность добавить защиту на этапе обучения без изменения схемы маршрутизации и серверного контура.

Ограничения. Авторы изучили четыре открытые архитектуры размером от 14B до 35B параметров; модели без общих экспертов остаются вне области применения. На Qwen3.5 с небольшим общим экспертом защита в отдельных составных атаках не компенсировала повреждение специализированных экспертов. Итоговая доля успешных атак зависит от выбранной модели-оценщика, а противники, способные целенаправленно использовать внутренний механизм SEAL, не проверялись. Сравнение поэтому не показывает, сохранится ли эффект на более крупных архитектурах, иных схемах обучения и при адаптивной атаке непосредственно на защитный адаптер.

Источники

Иллюстрация: рисунок из статьи «SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment», Qingyu Meng, Yiwei Zha, Jiahuan Pei и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу