Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Одного разобранного примера хватило, чтобы базовая LLM почти безошибочно прошла популярные проверки на справедливость. В препринте, который не прошёл рецензирование и содержит замеры самих авторов, точность Qwen 2.5 7B на BBQ выросла с 79,9% до 99%. Высокий балл здесь показывает, что модель распознала устройство теста, но не доказывает, что она стала справедливее в других задачах.
BBQ предлагает неоднозначные ситуации с тремя вариантами ответа. Если сведений недостаточно, модель должна выбрать нейтральный вариант, а не опираться на стереотип. Исследователи либо обучали базовую модель методом GRPO на одном таком задании, либо добавляли перед тестовым вопросом единственный разобранный пример без изменения весов модели. При обучении варианты ответов перемешивали, чтобы модель не запомнила правильную букву.
Один пример научил модель повторять общий ход рассуждения: если контекст не подтверждает вывод, следует ответить «недостаточно информации». Обучение подняло результат Qwen 2.5 7B до 92,9% и закрыло 80% разрыва с версией после масштабного обучения по человеческой обратной связи, которая набрала 96,1%. Контекстный пример превзошёл эту версию.
Эффект повторился на Qwen, Gemma, Llama и Mistral и перенёсся с BBQ на CrowS-Pairs, GenMO, StereoSet и WinoQueer. Но проверка на RealToxicityPrompts дала другую картину: масштабное обучение снижало токсичность продолжений, а обучение на одном примере BBQ не давало сопоставимого результата. Значит, тест фиксирует конкретный навык — отказаться от вывода при нехватке фактов, — а не справедливость модели в целом.
Эксперименты охватили модели размером 7–9 млрд параметров и 20 393 англоязычных задания, основанных преимущественно на американских демографических категориях и стереотипах. Для оценки продукта BBQ полезен как отдельная проверка отказа в неоднозначной ситуации, но его результат стоит дополнять тестами генерации, уверенности и устойчивости к замене демографических признаков.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



