Журнал · Rit.work

Формальные критерии не описывают весь человеческий выбор

Модель точнее воспроизводит человеческие предпочтения, когда учится на реальном выборе, а не только на проверках и словесных рубриках.

Rit.work
Студия разработки
5 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Человеческий выбор нельзя полностью свести к проверяемым правилам даже в математике и разработке ПО. Работа Stanford University и University of Toronto пока не рецензирована, а все числа получили сами авторы: в задачах по разработке ПО словесные критерии не охватывали 8–28% сигнала предпочтения. Для продукта это граница между свойствами, которые можно поручить автоматической проверке, и качеством, для которого придётся сохранить человеческую оценку или учить отдельную модель.

Исследователи сравнили три способа предсказывать выбор людей. Первый использовал исполняемые проверки: например, компилируется ли код и проходят ли тесты. Второй добавлял словесные рубрики, которые оценивала LLM. Третий обучался непосредственно на текстах и принятых людьми решениях, поэтому мог находить закономерности, которые никто заранее не сформулировал.

Полная модель чаще совпадала с реальным выбором, в том числе когда расходилась с рубриками. Чем сильнее обучение опиралось на сформулированные признаки, тем хуже модель сохраняла неописанную часть предпочтения. Обратного эффекта не нашли: обучение на полном сигнале не мешало учитывать явные критерии.

Проверку провели на CreativePreferences: 2,8 млн текстов, семь областей и 42 задачи. В набор вошли код, математика, право, научные статьи, журналистика, художественная проза и юмор. Метками служили не ответы специально нанятых оценщиков, а реальные решения: принятие работы, выбор редакции или жюри и голоса сообщества.

Практическая граница проходит по типу качества. Компиляцию, тесты и соблюдение формата стоит фиксировать проверками. Новизну, ясность, уместность и ценность для сообщества нельзя считать полностью описанными даже подробной рубрикой. В таких задачах формальные критерии лучше использовать как ограничения, а итоговый выбор оставлять модели, обученной на человеческих решениях, или человеку в контуре.

Источники

Иллюстрация: рисунок из статьи «Verifiable, Articulable, and Tacit Components of Preference», Alexander Spangher, Sheldon Huang, Andreas Haupt и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу