Журнал · Rit.work

Обучение по предпочтениям научило LLM учитывать надёжность источника

Эксперимент показал, как научить LLM сравнивать заявленную надёжность источника со своей исходной уверенностью, а не просто соглашаться или сопротивляться.

Rit.work
Студия разработки
22 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель можно научить менять ответ только тогда, когда заявленная надёжность спорящего источника выше её исходной уверенности. Sen Yang и Yuen-Hei Yeung показали это на двух семействах LLM; работа пока не рецензирована, а числа получили сами авторы. На Qwen2.5-7B-Instruct точность такого выбора достигла 0,84 — значит, борьбу с податливостью стоит строить вокруг условий доверия, а не общего запрета соглашаться.

Один коэффициент превращает осторожность в упрямство

Обычное обучение против податливости сводит разные ситуации к двум командам: сохранить ответ под социальным давлением или принять аргументированный ответ источника. Для обучения по предпочтениям модель получает предпочтительный и отклонённый варианты ответа, но метка не всегда отражает надёжность собеседника.

Из-за этого единый коэффициент управляет только общей готовностью соглашаться. Когда доля правильных обновлений выросла с 0 до 0,97, доля отклонений бесполезного источника упала с 0,85 до 0. Модель стала лучше принимать полезные свидетельства ценой почти безусловного доверия к источникам той же формы.

Обратная настройка даёт другую крайность: модель сопротивляется слабому источнику, но игнорирует сильный. Даже источник с надёжностью 50% требует сохранить прежний ответ, однако стандартная цель обучения не выделяет это условие. Получается не переключатель доверия, а один регулятор между доверчивостью и фиксацией на первом ответе.

Эта граница получена эмпирически, а не доказана для всех моделей и задач. Её причина в устройстве обучающих примеров: если предпочтительная реакция не зависит от надёжности источника, оптимизатору незачем учиться её учитывать.

Порог доверия пришлось сделать частью данных

В новом тесте источник оспаривает ответ модели и прямо называет свою надёжность r. У модели уже есть исходная уверенность p, рассчитанная по свидетельствам из первой части задания. Правильное действие задаёт правило: изменить ответ, только если r выше p.

Одинаковая надёжность источника ведёт к разным решениям на разных заданиях. Если модель слабо уверена в исходном ответе, она должна согласиться; если уверена сильнее источника — сохранить ответ. Поэтому запомнить соответствие между числом и действием недостаточно: нужно сравнить две величины.

Для Qwen2.5-7B-Instruct собрали сбалансированные примеры обоих действий и обучили модель методом DPO. Точность решений достигла 0,84. На значениях надёжности, которых не было в обучении, она составила 0,66, а при записи надёжности процентами — 0,81.

Контрольные опыты отделили эффект данных от конкретного рецепта. Обучение с учителем на тех же правильных ответах дало 0,50 и не сформировало порог. Другой метод обучения по предпочтениям, IPO, достиг 0,86; при этом необязательно было помещать противоположные действия в пару для одного задания.

Результат повторился на новой тестовой подборке и перенёсся на Llama-3.1-8B-Instruct. Проверка охватывала искусственные задачи с явно указанной надёжностью, две модельные семьи и два метода обучения по предпочтениям. Она не показывает, что тот же механизм возникнет из обычных текстов, где надёжность приходится выводить косвенно.

Командам нужен контракт доверия, а не запрет соглашаться

Работа меняет план обучения моделей, которые читают отчёты агентов, рекомендации экспертов или результаты внешних инструментов. Общая награда за сопротивление чужому мнению может закрепить упрямство, а награда за обновление ответа — доверчивость. В обучающих данных должны присутствовать надёжность источника, исходная уверенность модели и правильные действия по обе стороны порога.

Баланс тоже имеет значение. Если примеры чаще требуют сохранить ответ, модель смещает порог вверх и реже принимает даже полезные сведения. В эксперименте порог проходил примерно на 0,1 выше расчётной границы: модель сохраняла ответ осторожнее, чем требовало правило.

Главная граница результата проходит по самому сигналу надёжности. Модель ориентировалась на число, которое источник сообщал о себе, а не на отдельную аудиторскую оценку; ложное заявление могло её обмануть. Запись в процентах переносилась, но формат вроде «верен в трёх случаях из четырёх» дал только 0,43, поэтому нужные представления чисел и конфликты между самооценкой и аудитом придётся явно включать в обучение.

Практический вывод касается не выбора между DPO и IPO, а состава данных. Сначала нужно определить, какие признаки должны менять решение, затем покрыть сочетания этих признаков с исходным состоянием модели и лишь после этого оптимизировать предпочтения. Иначе модель освоит общий стиль поведения вместо требуемого правила доверия.

Источники

Иллюстрация: рисунок из статьи «Resist, Update, Reject: Preference Optimization Installs a Prior-Dependent Reliability Switch», Sen Yang, Yuen-Hei Yeung, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу