Журнал · Rit.work

Как провести узкую границу отказа внутри одной темы

Парные вредные и допустимые запросы помогают настроить LLM так, чтобы она блокировала политическую манипуляцию, но продолжала отвечать на нейтральные вопросы.

Rit.work
Студия разработки
7 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель можно научить отказываться от политической манипуляции, не закрывая для неё всю политическую тему. В нерецензированном препринте Multiverse Computing, где числа получили сами авторы, парные вредные и допустимые запросы снизили ложные отказы на допустимой стороне границы с 32,94% до 4,16%. Для продуктовой команды это превращает безопасность из списка запрещённых тем в задачу проектирования данных по обе стороны конкретного правила.

Границу проверяли на почти одинаковых запросах

Обычная настройка безопасности делит запросы по крупным категориям: политика, оружие, мошенничество. Такой подход плохо подходит продукту, который должен обсуждать выборы и государственное устройство, но не должен писать персонализированную агитацию или помогать с пропагандой.

В работе граница проходит не между темами, а между намерениями внутри одной темы. Запрос на нейтральное объяснение политического события допустим, а запрос на манипулятивное сообщение для конкретной аудитории требует отказа. Модель должна учитывать цель пользователя, а не реагировать на отдельные опасно звучащие слова.

Для проверки авторы строили пары с общим тематическим основанием. В одной версии пользователь просит о манипуляции, в другой — фактический ответ или нейтральное объяснение. Эти пары разделили на обучающую и отложенную части, поэтому модель проверяли на формулировках, которых она не видела при настройке.

Такой тест показывает форму границы. Если отказы растут сразу на обеих сторонах пары, модель не научилась различать намерения, а лишь стала осторожнее. Дополнительно использовали XSTest: этот набор состоит из безопасных запросов со словами и темами, которые часто вызывают ошибочную блокировку.

Обучающие запросы генерировали по иерархии из подтем, намерений, ролей, стилей и вариантов длины. Затем сама целевая модель создавала ответы с отказом, а WildGuard отбраковывал неподходящие варианты. Если получить подтверждённый отказ не удавалось, система повторяла генерацию с более строгими инструкциями или подставляла проверенный нейтральный отказ.

Вредные примеры напрямую учили модель отказывать. На допустимых ответах её одновременно удерживали рядом с поведением исходной замороженной модели. Это снижает риск, что настройка одной узкой политики изменит ответы по всей теме.

Полное покрытие вредных запросов само по себе ломает полезность

При одной попытке генерации без подходящего отказа оставались 19,88% вредных запросов. Последовательные повторные попытки сократили этот разрыв до 0,20%. Без такого ремонта из обучающего набора исчезают как раз запросы, на которых модель труднее всего склонить к отказу.

На Qwen3-8B доля отказов в целевой области выросла с 9,47% до 84,75%. Однако та же конфигурация ошибочно отклоняла 74% безопасных запросов XSTest. Высокий результат на вредных примерах здесь означал не точную границу, а общее расширение зоны отказа.

Состав допустимой части набора менял этот баланс. Ответы, которые создала и прошла сама целевая модель, давали меньше ложных отказов, чем ответы из внешнего источника. Парные допустимые примеры действовали локальнее: они возвращали ответы на запросы рядом с границей, при этом отказ на вредной стороне снижался заметно слабее.

Отсюда следует практическое требование к оценке: метрика отказов на вредных запросах не должна использоваться отдельно. Рядом нужна метрика ложных отказов на обычных безопасных данных и отдельная проверка пар, где тема остаётся прежней, а намерение меняется.

Командам придётся проектировать политику как набор контрастов

Если продукт уже блокирует целые темы внешним классификатором, работа не даёт причины немедленно менять архитектуру. Она показывает другой вариант для случаев, когда политика продукта уже стандартной таксономии: настроить границу внутри модели на этапе дополнительного обучения, а не принимать решение только по названию темы.

План подготовки данных при этом меняется. Для каждого запрещённого намерения нужен близкий допустимый пример, а не случайный безопасный диалог из другой области. Полезно отдельно собирать запросы, которые выглядят опасно из-за слов, но требуют нормального ответа, и проверять, что ответы для них соответствуют обычному поведению базовой модели.

Нельзя молча удалять запросы, для которых модель не смогла создать учебный отказ. Такой сбой становится сигналом о пробеле в покрытии: запрос стоит повторно обработать или заполнить проверенным ответом. Иначе итоговая модель хорошо выучит удобные формулировки и сохранит слабое место там, где генерация учебных данных не сработала.

Работу проверяли на политическом убеждении; основные опыты провели с Qwen3-8B и одной конфигурацией адаптера LoRA, а отдельные сравнения — с DeepSeek-R1-Distill-Qwen-7B. Ответы оценивали автоматические модели LlamaGuard-3 и WildGuard. Поэтому результаты поддерживают схему подготовки и проверки данных, но не дают универсальной оценки качества для других политик, семейств моделей и продуктовых условий.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу