Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель вознаграждения научили учитывать, что разные люди могут стабильно предпочитать разные варианты, а не считать их разногласия шумом. В препринте Toyota Research Institute, который не прошёл рецензирование и приводит замеры самих авторов, индивидуальная модель обошла общую во всех проверенных задачах. Для субъективных продуктов это меняет схему сбора данных: вместе с оценкой стоит сохранять сведения о том, кто её дал.
Разногласие стало частью функции полезности
Обычная модель предпочтений ищет одну функцию полезности для всей аудитории. Функция полезности присваивает варианту число: чем оно выше, тем вероятнее человек выберет этот вариант. Если два аннотатора отвечают по-разному, модель считает расхождение случайной ошибкой и учится предсказывать средний выбор.
Такой подход подходит задачам с проверяемым ответом. В оценке стиля, текста или допустимого риска один общий ответ может скрывать устойчивые различия между группами и отдельными людьми.
Предложенная модель получает три вида данных: характеристики участника, критерий оценки и оцениваемый вариант. Отдельные кодировщики превращают их в числовые представления, после чего нейросеть вычисляет полезность каждого из двух вариантов. Разница между оценками задаёт вероятность выбора, а модель учится на фактических попарных сравнениях.
Работа рассматривает две архитектуры. В первой каждый критерий, например «спортивный» или «элегантный», получает собственную сеть полезности. Во второй одна сеть обслуживает все критерии и принимает название задачи как дополнительный вход. На этих данных отдельные сети работали лучше общей: смысловая близость слов, обозначающих критерии, не обеспечила полезного переноса предпочтений между ними.
Сведения об участнике дали до восьми пунктов точности
Метод проверяли на более чем 575 000 попарных оценок автомобильных колёс от 2 398 участников. Люди сравнивали дизайны по девяти эстетическим критериям, среди которых спортивность, роскошь, футуристичность и элегантность. Представление участника строили из демографических и социально-экономических признаков.
Главный тест сравнивал индивидуальную модель с той же архитектурой без сведений об участнике. Удаление этих сведений снижало точность на 2–8 процентных пунктов в зависимости от критерия. Разрыв возник во всех задачах: для элегантности и обтекаемости индивидуальные различия помогали сильнее, чем для спортивности.
Это показывает, что часть расхождений можно предсказать по устойчивым признакам человека. Общая модель не просто ошибается на случайных ответах — она стирает структуру предпочтений, когда сводит разные функции полезности к среднему значению.
Проверка также включала новые варианты и новых участников, которых модель не видела при обучении. Индивидуальная функция полезности переносилась на них, хотя используемые демографические признаки объясняли только часть различий. Поведенческая история, личностные характеристики и прежние решения могут дать более содержательное представление пользователя, но в этой работе их не оценивали.
Подстановка демографического описания в запрос к Claude Sonnet почти не улучшила прогноз относительно запроса только с вариантами. Обе схемы работали на уровне общей нейросетевой модели или хуже неё. Одного описания персоны во время запроса оказалось недостаточно: связь между признаками человека и его решениями пришлось учить на реальных оценках.
Схему разметки стоит изменить раньше архитектуры
Для продукта с субъективной целью работа меняет прежде всего сбор обратной связи. Если хранить только пару вариантов и победителя, позднее нельзя будет отделить общий вкус от предпочтений конкретных групп. Нужны стабильный идентификатор аннотатора и признаки, которые могут объяснить его решения.
Второе следствие касается целевой функции. Единственная модель вознаграждения подходит, если продукт намеренно оптимизирует среднее мнение аудитории. Если результат должен подстраиваться под пользователя или сегмент, полезность следует вычислять с учётом этого пользователя, а не добавлять персонализацию только в запрос к готовой LLM.
Разделять сети по критериям сразу необязательно, но этот вариант стоит включить в эксперимент. Здесь независимые функции работали лучше совместной, поэтому общая сеть для «качества», «стиля» и «уместности» не должна быть автоматическим выбором только ради повторного использования параметров.
Граница результата проходит по субъективной визуальной оценке автомобильного дизайна. Работа обосновывает пилот для рекомендаций, настройки стиля и других задач с устойчивыми личными вкусами, но не заменяет проверку на данных конкретного продукта. Для задач с объективно правильным ответом усреднение по аннотаторам остаётся другой постановкой.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



