Журнал · Rit.work

BA-DPO отделяет смещение разметчиков от качества ответа

BA-DPO выносит склонность разметчиков к длине, оформлению или заданному маркеру из сигнала качества и позволяет управлять долей этого атрибута в ответах LLM.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систематическую склонность разметчиков выбирать длинные ответы, определённое оформление или заданный маркер научились отделять от сигнала качества при настройке LLM по предпочтениям. Хотя препринт не рецензирован и числа получили сами авторы, команда Intesa Sanpaolo AI Research показала, что BA-DPO убирает 81–95% сдвига на данных с искусственно внесённым смещением. Метод позволяет сохранить исходную частоту атрибута или задать целевую, не обучая отдельную модель награды.

Как BA-DPO отделяет атрибут от качества

Прямая оптимизация предпочтений DPO обучает модель на парах ответов: разметчик выбирает лучший, после чего модель повышает его вероятность относительно проигравшего. Метод предполагает, что выбор отражает качество, поэтому любая устойчивая склонность разметчиков тоже попадает в модель.

Если люди чаще выбирают ответы с Markdown, длинные формулировки или подписи с именами определённой группы, DPO принимает этот признак за полезный. Общее смещение не исчезает при объединении оценок: модель видит много согласованных голосов и усиливает атрибут.

BA-DPO требует заранее указать признак, влияние которого нужно отделить. Для каждого разметчика и атрибута метод добавляет один числовой параметр. Если склонность разметчика объясняет выбор победителя, такая пара слабее меняет модель; если ответ победил вопреки склонности, её вес растёт. Пары, где оба ответа одинаковы по заданному признаку, обрабатываются как в обычном DPO.

Отдельная модель награды и дополнительная нейросеть не нужны. Если идентификаторы разметчиков недоступны, можно использовать один общий параметр для всего набора оценок. Несколько признаков задаются одновременно отдельными параметрами.

Функция потерь выпукла по параметрам смещения, но голоса определяют только различия между разметчиками. Они не позволяют установить, какая часть общей склонности относится к качеству, а какая — к коллективному уклону. Поэтому BA-DPO оставляет команде выбор: удержать частоту атрибута на уровне исходной модели либо задать целевую долю, например для статистического паритета.

На подписях эффект почти исчез, на длине сократился вдвое

Для контролируемого опыта ответы из UltraFeedback дополнили подписями с именами, которые кодировали пол и расовую группу, а предпочтения разметчиков сгенерировали с известным смещением. Обычный DPO поднял вероятность предпочитаемого маркера со сбалансированного уровня до 0,96. BA-DPO убрал 81–95% этого сдвига.

На MultiPref использовали оценки реальных разметчиков и два признака, которые можно вычислить по самому ответу: относительную длину и наличие Markdown. BA-DPO устранил примерно половину удлинения, которое создавал DPO. При этом модель не отклонялась от исходной сильнее по расхождению KL — мере изменения распределения ответов — и не теряла качество по независимой модели-оценщику.

Для Markdown исходный сдвиг DPO оказался в пределах разброса между запусками, поэтому этот опыт не подтверждает столь же заметного улучшения. Он показывает более узкий результат: BA-DPO способен убрать связь между объявленным признаком и предпочтением, не перенося поправку автоматически на другие признаки.

Когда метод стоит включать в план обучения

BA-DPO меняет план команды, если уже известен нежелательный кратчайший путь в разметке. Это может быть длина, форматирование, языковой вариант, персона или иной признак, который надёжно вычисляется для каждого ответа. Вместо очистки оценок вручную его можно включить непосредственно в обучение и сохранить обычную схему DPO.

В конвейере разметки стоит сохранять псевдонимный идентификатор оценщика: тогда модель разделит общий уклон и индивидуальные отклонения. Такие идентификаторы и рассчитанные по ним параметры следует считать персональными данными. Если связать оценки с конкретными людьми нельзя, остаётся объединённый вариант, который оценивает только общую склонность.

Работу проверяли на моделях с 0,5, 7 и 8 млрд параметров: малую модель дообучали полностью, более крупные — через LoRA, где меняется небольшая часть параметров. Доказательная база охватывает синтетические социальные маркеры и поверхностные признаки реального корпуса, а качество проверяет одна модель-оценщик.

Метод не обнаруживает скрытые смещения сам: атрибут нужно назвать и вычислить заранее. Необъявленный признак остаётся в политике, а исправление одного признака не исправляет остальные. Кроме того, привязка к исходной модели сохраняет её собственную частоту атрибута; если нужен другой уровень, команда должна выбрать его как продуктовое или нормативное требование.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу