Журнал · Rit.work

Отказ LLM оказался уже её морального понимания

Отказ модели может читать лишь узкий сигнал вреда, тогда как моральное содержание хранится отдельно и различается между семействами LLM.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель может понимать моральный смысл запроса шире, чем использует при решении отказать. В препринте Orion Reblitz-Richardson, который не прошёл рецензирование и где все числа получены самим автором, на OLMo-3 около 76% влияния, определявшего отказ, лежало вне морального подпространства. Поэтому сам отказ ещё не показывает, что модель связала решение со всем доступным ей контекстом.

Автор разделил моральное понимание и механизм отказа. Для этого он переносил между сходными запросами всё более широкие части внутренних представлений модели и проверял, изменятся ли моральная оценка и готовность отвечать. Моральная оценка продолжала учитывать новые части представления, а отказ быстро переставал меняться: ему хватало узкого сигнала вреда.

Моральное представление возникало ещё во время предварительного обучения, а последующая настройка лишь поворачивала его в пространстве признаков. Механизм отказа формировался позднее в отдельном узком канале. Такая структура объясняет, почему правка одного направления во внутренних представлениях может убрать отказ, не разрушив способность модели отличать допустимые ситуации от недопустимых.

Основной причинный эксперимент провели только на OLMo-3 и на 42 парах запросов. Остальные модели служили проверкой различий между семействами: Llama учитывала широкое моральное содержание, Qwen читала больше одного сигнала вреда, но результат остался неопределённым, а GPT-OSS опиралась на вред и могла пересмотреть отказ после оправдывающего контекста. Значит, переносить устройство защитного слоя с одной модели на другую нельзя: при выборе основы для продукта нужно отдельно проверять, что именно запускает отказ и насколько решение сохраняется после дальнейшего рассуждения.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу