Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Культурные стереотипы в генераторах изображений возникают ещё до отрисовки: их добавляет промежуточный текстовый слой. В препринте команды из University of Zurich, University of Helsinki, ETH Zurich и Stanford University, который не прошёл рецензирование и приводит замеры самих авторов, американский контекст оказался ближе всех к варианту без указания страны, а незападные и неанглоязычные контексты получили больше культурных маркеров. Исправлять только модель изображений поэтому недостаточно: проверять нужно всю цепочку от запроса до результата.
DALL-E-3, Imagen-4 и GPT-Image-1.5 перед генерацией расширяют, переводят или иначе меняют запрос пользователя. В веб-интерфейсе этот промежуточный текст обычно не виден, а отключить его, как правило, нельзя; исследователи получили изменённые запросы через API и проверили, какие слова система добавляет.
Для аудита собрали WORLDVIEW: 8 960 бытовых запросов на 15 языках для 31 сочетания языка и культурного контекста. Анализ измерял, насколько переписанный запрос отдаляется от английского варианта без страны, не сводит ли систему культуру к небольшому набору повторяющихся слов и совпадают ли эти слова с узнаваемыми стереотипами. Так, Финляндия регулярно сводилась к зимним образам, а Египет — к фараонским мотивам, даже когда исходные темы с ними не были связаны.
Чтобы отделить переписывание от предубеждений самой модели изображений, исходные и изменённые запросы GPT-Image передали в SDXL и Flux, где такого слоя нет. На четырёх англоязычных контекстах изменённые запросы усилили культурную маркировку и сузили набор образов; поскольку оба варианта рисовала одна и та же модель, различие связано именно с добавленным текстом.
Основной аудит охватывает системы OpenAI и Google, а причинное сравнение в полном объёме проведено только для США, Великобритании, Австралии и Индии. Результат не задаёт, как должна выглядеть корректная культурная репрезентация, но показывает практическую точку проверки: при аудите собственного продукта нужно сохранять и сравнивать исходный запрос, его скрытую редакцию и итоговое изображение.
Источники
Иллюстрация: рисунок из статьи «Prompt Revision as a Source of Cultural Bias in Text-to-Image Systems», Aleksandra Urman, Elsa Lichtenegger, Salima Jaoua и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



