Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Донастройка чат-модели меняет не только ответы ассистента, но и её прогноз того, что напишет пользователь. В препринте Jord Nguyen, который не прошёл рецензирование и содержит замеры самого автора, базовые модели считали условный бросок монеты почти честным, а Qwen 2.5 14B после пост-обучения отдавала безопасному исходу 83% вероятности вместо ожидаемых 50%. Значит, при анализе безопасности нельзя считать пользовательскую реплику нейтральной частью модели: предпочтения ассистента проявляются ещё до начала его ответа.
В тесте пользователь сообщал, что бросок монеты определит его следующую просьбу: безопасную или вредную. Сообщение обрывали перед результатом, а модель должна была предсказать следующее слово — «орёл» или «решка». Авторы меняли порядок задач и соответствие исходов, чтобы предпочтение конкретного слова или первой позиции не влияло на итог.
У базовых Llama, Qwen и Gemma перекос оставался около нуля, а у большинства версий Instruct рос вместе с размером модели. На промежуточных версиях OLMo эффект появлялся после DPO — этапа, где модель учат предпочитать одни ответы другим, — но только в ветке Instruct. В ветке Think, где сравнивали качество рассуждений, такого сдвига не возникло.
Узкая донастройка на вредных ответах тоже меняла прогноз пользователя, хотя примеры не содержали вредных пользовательских реплик. У Llama 3.1 8B некоторые адаптеры даже развернули предпочтение в сторону вредной задачи. Анализ слоёв показал, что перекос накапливается ближе к выходу сети, а не проходит через всю модель с первых слоёв.
Проверка охватила открытые модели трёх семейств размером до 72 млрд параметров и синтетические комбинации безопасных и вредных задач. Она не показывает поведение на обычных диалогах, но ставит практическую границу для интерпретации: пост-обучение может менять не отдельную роль ассистента, а общий механизм предсказания собеседника. Поэтому внутренние представления и защитные донастройки стоит проверять не только на позиции ответа, но и внутри незавершённой пользовательской реплики.
Источники
Иллюстрация: рисунок из статьи «Measuring the Assistant's Harmlessness Preferences on the User Turn», Jord Nguyen, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



