Журнал · Rit.work

Нейтральный запрос становится стереотипным до отрисовки

Аудит DALL-E-3, Imagen-4 и GPT-Image-1.5 показал, что культурные стереотипы добавляет не только модель изображений, но и скрытый слой переписывания запросов.

Rit.work
Студия разработки
12 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Культурные стереотипы в генераторах изображений возникают ещё до отрисовки: их добавляет промежуточный текстовый слой. В препринте команды из University of Zurich, University of Helsinki, ETH Zurich и Stanford University, который не прошёл рецензирование и приводит замеры самих авторов, американский контекст оказался ближе всех к варианту без указания страны, а незападные и неанглоязычные контексты получили больше культурных маркеров. Исправлять только модель изображений поэтому недостаточно: проверять нужно всю цепочку от запроса до результата.

DALL-E-3, Imagen-4 и GPT-Image-1.5 перед генерацией расширяют, переводят или иначе меняют запрос пользователя. В веб-интерфейсе этот промежуточный текст обычно не виден, а отключить его, как правило, нельзя; исследователи получили изменённые запросы через API и проверили, какие слова система добавляет.

Для аудита собрали WORLDVIEW: 8 960 бытовых запросов на 15 языках для 31 сочетания языка и культурного контекста. Анализ измерял, насколько переписанный запрос отдаляется от английского варианта без страны, не сводит ли систему культуру к небольшому набору повторяющихся слов и совпадают ли эти слова с узнаваемыми стереотипами. Так, Финляндия регулярно сводилась к зимним образам, а Египет — к фараонским мотивам, даже когда исходные темы с ними не были связаны.

Чтобы отделить переписывание от предубеждений самой модели изображений, исходные и изменённые запросы GPT-Image передали в SDXL и Flux, где такого слоя нет. На четырёх англоязычных контекстах изменённые запросы усилили культурную маркировку и сузили набор образов; поскольку оба варианта рисовала одна и та же модель, различие связано именно с добавленным текстом.

Основной аудит охватывает системы OpenAI и Google, а причинное сравнение в полном объёме проведено только для США, Великобритании, Австралии и Индии. Результат не задаёт, как должна выглядеть корректная культурная репрезентация, но показывает практическую точку проверки: при аудите собственного продукта нужно сохранять и сравнивать исходный запрос, его скрытую редакцию и итоговое изображение.

Источники

Иллюстрация: рисунок из статьи «Prompt Revision as a Source of Cultural Bias in Text-to-Image Systems», Aleksandra Urman, Elsa Lichtenegger, Salima Jaoua и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу