Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель, которая работает с изображениями и текстом (VLM), научили замечать риск в сочетании двух безобидных по отдельности входов и при этом не отказываться от допустимой помощи. Haotian Deng и коллеги в препринте, который не прошёл рецензирование и содержит их собственные замеры, подняли долю одновременно безопасных и полезных ответов с 43,9% до 53,5%, не добавляя отдельную проверку при работе модели.
Почему готовое описание намерения провоцирует лишние отказы
Неявный риск возникает не в изображении или запросе по отдельности, а в связи между ними. Фотография предмета может выглядеть нейтрально, как и просьба объяснить действие, однако вместе они указывают на опасную ситуацию. Фильтр, который ищет запрещённые слова или объекты, такую связь пропускает.
Намерение пользователя кажется удобной подсказкой для модели, но его легко описать слишком уверенно. Исходные аннотации из Meerkat-Safe иногда приписывали человеку мотив, которого нельзя подтвердить по входным данным, или выбирали опасное толкование там, где оставалась допустимая версия. Получив такую подсказку, замороженная модель чаще начинала ответ с отказа и реже давала безопасную полезную альтернативу.
Для OPSD намерение разметили заново. Сначала отдельные агенты извлекали наблюдаемые детали из изображения и буквальный смысл запроса. Затем другой агент связывал их, а проверяющий отбрасывал неподтверждённые мотивы, готовые ответы, прямые команды отказаться и явные метки безопасности.
Итоговая аннотация фиксирует факты, возможные безопасные толкования, нерешённые условия и границы допустимого ответа. Если из запроса нельзя понять, есть ли у пользователя разрешение на действие, подсказка сохраняет эту неопределённость, а не объявляет намерение вредным.
Как подсказка переходит в модель за одну выборку ответа
Аннотацию видит только замороженная модель-учитель. Ученик получает исходные изображение и запрос, генерирует один ответ своей текущей версией, а затем сравнивает на каждом шаге свои вероятности продолжения с вероятностями учителя. Так учитель показывает не только итоговую оценку, но и места, где продолжение становится чрезмерно осторожным, бесполезным или небезопасным.
Для обучения собрали 1 447 примеров с проверенным намерением. К ним добавили обычные мультимодальные задания с эталонными ответами: они удерживают способность модели решать общие задачи, пока настройка меняет её поведение в опасных и неоднозначных случаях.
После обучения подсказки и учитель больше не нужны. Остаётся ученик с адаптерами LoRA, который отвечает непосредственно по изображению и запросу. Ему не требуются отдельный классификатор риска, маршрутизатор или обязательная цепочка рассуждений перед ответом.
Основные опыты проводили на Qwen3-VL-4B-Instruct в пяти группах проверок, составленных из SIUO, HoliSafe, BeaverTails-V, MSSBench, MOSSBench и MM-SafetyBench. Метод показал лучший совместный результат во всех группах, хотя на MSSBench лишь сравнялся с исходной моделью. Перемешивание аннотаций между запросами почти убирало преимущество: помогает соответствие подсказки конкретной паре изображения и текста, а не сам факт добавления структурированного текста о безопасности.
Командам стоит менять обучение, но не защиту продукта
Работа меняет план постобучения для команд, которые контролируют веса VLM. Вместо большого набора пар «хороший и плохой ответ» можно проверить схему, где сильная модель получает подробный контекст только во время обучения, а рабочая модель учится воспроизводить её границы без этого контекста.
В рассмотренной конфигурации OPSD потребовал на 95% меньше специализированных примеров, чем сравниваемый метод на предпочтениях. Обучение заняло примерно впятеро меньше времени, чем вариант на основе GRPO, при замере на одной NVIDIA A800. Это сравнение стендовых конфигураций, а не доказательство такого же сокращения вычислений при любом размере модели и наборе данных.
Архитектуру выдачи ради OPSD усложнять не придётся: средняя длина ответа после настройки сократилась на 7%. Для сервиса это означает, что дополнительная безопасность не обязана создавать ещё один вызов модели и отдельную задержку.
Для закрытого API без доступа к постобучению подход напрямую неприменим. Командам со своими весами придётся вложиться не только в обучение, но и в разметку: опыт с исходными и перемешанными аннотациями показывает, что ошибочное описание намерения модель усваивает так же последовательно, как полезное.
Замеры сделаны на курируемых наборах и не заменяют испытания на реальных диалогах, длинных сценариях и данных конкретного продукта. Поэтому OPSD даёт основание упростить экспериментальный контур обучения, но пока не основание автоматически убирать действующие производственные проверки.
Источники
Иллюстрация: рисунок из статьи «Can Vision-Language Models Stay Helpful When Facing Implicit Risks? Intent-Privilege OPSD for Efficient Safety-Helpfulness Alignment», Haotian Deng, Wenbin Xing, Gang Xu и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



