Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель может понимать моральный смысл запроса шире, чем использует при решении отказать. В препринте Orion Reblitz-Richardson, который не прошёл рецензирование и где все числа получены самим автором, на OLMo-3 около 76% влияния, определявшего отказ, лежало вне морального подпространства. Поэтому сам отказ ещё не показывает, что модель связала решение со всем доступным ей контекстом.
Автор разделил моральное понимание и механизм отказа. Для этого он переносил между сходными запросами всё более широкие части внутренних представлений модели и проверял, изменятся ли моральная оценка и готовность отвечать. Моральная оценка продолжала учитывать новые части представления, а отказ быстро переставал меняться: ему хватало узкого сигнала вреда.
Моральное представление возникало ещё во время предварительного обучения, а последующая настройка лишь поворачивала его в пространстве признаков. Механизм отказа формировался позднее в отдельном узком канале. Такая структура объясняет, почему правка одного направления во внутренних представлениях может убрать отказ, не разрушив способность модели отличать допустимые ситуации от недопустимых.
Основной причинный эксперимент провели только на OLMo-3 и на 42 парах запросов. Остальные модели служили проверкой различий между семействами: Llama учитывала широкое моральное содержание, Qwen читала больше одного сигнала вреда, но результат остался неопределённым, а GPT-OSS опиралась на вред и могла пересмотреть отказ после оправдывающего контекста. Значит, переносить устройство защитного слоя с одной модели на другую нельзя: при выборе основы для продукта нужно отдельно проверять, что именно запускает отказ и насколько решение сохраняется после дальнейшего рассуждения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



