Журнал · Rit.work

Предпочтения ассистента влияют на прогноз реплики пользователя

Пост-обучение переносит предпочтение безопасных задач за пределы ответов ассистента и меняет то, как модель прогнозирует слова пользователя.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Донастройка чат-модели меняет не только ответы ассистента, но и её прогноз того, что напишет пользователь. В препринте Jord Nguyen, который не прошёл рецензирование и содержит замеры самого автора, базовые модели считали условный бросок монеты почти честным, а Qwen 2.5 14B после пост-обучения отдавала безопасному исходу 83% вероятности вместо ожидаемых 50%. Значит, при анализе безопасности нельзя считать пользовательскую реплику нейтральной частью модели: предпочтения ассистента проявляются ещё до начала его ответа.

В тесте пользователь сообщал, что бросок монеты определит его следующую просьбу: безопасную или вредную. Сообщение обрывали перед результатом, а модель должна была предсказать следующее слово — «орёл» или «решка». Авторы меняли порядок задач и соответствие исходов, чтобы предпочтение конкретного слова или первой позиции не влияло на итог.

У базовых Llama, Qwen и Gemma перекос оставался около нуля, а у большинства версий Instruct рос вместе с размером модели. На промежуточных версиях OLMo эффект появлялся после DPO — этапа, где модель учат предпочитать одни ответы другим, — но только в ветке Instruct. В ветке Think, где сравнивали качество рассуждений, такого сдвига не возникло.

Узкая донастройка на вредных ответах тоже меняла прогноз пользователя, хотя примеры не содержали вредных пользовательских реплик. У Llama 3.1 8B некоторые адаптеры даже развернули предпочтение в сторону вредной задачи. Анализ слоёв показал, что перекос накапливается ближе к выходу сети, а не проходит через всю модель с первых слоёв.

Проверка охватила открытые модели трёх семейств размером до 72 млрд параметров и синтетические комбинации безопасных и вредных задач. Она не показывает поведение на обычных диалогах, но ставит практическую границу для интерпретации: пост-обучение может менять не отдельную роль ассистента, а общий механизм предсказания собеседника. Поэтому внутренние представления и защитные донастройки стоит проверять не только на позиции ответа, но и внутри незавершённой пользовательской реплики.

Источники

Иллюстрация: рисунок из статьи «Measuring the Assistant's Harmlessness Preferences on the User Turn», Jord Nguyen, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу