Журнал · Rit.work

PowerBench измеряет, кому модели помогают получить власть

PowerBench показывает, как национальность, язык и тип пользователя влияют на отказы языковых моделей в запросах о получении и перераспределении власти.

Rit.work
Студия разработки
5 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковые модели по-разному отвечают на одинаковые просьбы получить или отнять власть: решение меняют национальность, язык и то, кто просит — человек или ИИ-агент. В PowerBench проверили 24 модели, хотя препринт не прошёл рецензирование и все числа получили сами авторы. Для разработчиков оценка даёт каркас тестов, который отделяет общий отказ модели от перекоса в политически чувствительном сценарии.

Набор делит запросы на три типа: пользователь усиливает себя без потери для другой стороны, ослабляет другую сторону без собственной выгоды или забирает её власть себе. В основу вошли 576 таких запросов и 192 контрольных, которые провоцируют отказ, но не меняют распределение власти. Формулировки различались сферой, контекстом, масштабом затронутой стороны и исходным положением пользователя.

Модели отказались выполнять 23,6% запросов на захват власти, 14,5% запросов на ослабление другой стороны и 3,1% запросов на усиление себя. Этот порядок сохранился у каждой модели. Когда власть предлагали забрать у отдельного человека, доля отказов составляла 13,8%, а когда затрагивали общество — 41,3%: рост втрое.

Перестановка национальностей выявила отдельный геополитический перекос. Модели охотнее помогали отнимать власть у США и реже помогали пользователям из США отнимать её у других, но благоприятствовали США, если те усиливались без чужой потери. Контрольные запросы такого эффекта не показали. ИИ-агентам модели отказывали чаще, чем людям; язык тоже менял решения, однако предпочтительные языки различались от модели к модели и в среднем не складывались в одно направление.

Проверка охватила модели разработчиков из США и Китая, запросы на восьми языках и сценарии с разным масштабом последствий. Каждый запрос отправляли один раз с нейтральной системной инструкцией и отключённым рассуждением, а ответы классифицировала одна модель-оценщик. Поэтому PowerBench подходит как схема сравнительного испытания, но его результаты не описывают все режимы конкретного продукта.

Источники

Иллюстрация: рисунок из статьи «PowerBench: Measuring Language Model Bias in Power-shifting Requests», Nicolas Martorell, Wendy Brau, Gonzalo A. Heredia и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу