Журнал · Rit.work

Одна оценка психологических смещений скрывает разные причины ответов LLM

PsyAgentBench показал, что LLM воспроизводят психологические эффекты из-за узнавания задачи, заданной роли, доступных сведений и защитных ограничений.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Человекоподобный ответ LLM оказался ненадёжным признаком того, что модель подвержена тому же психологическому смещению, что и человек. В PsyAgentBench Joy Bose получил для gpt-oss-120B эффект конформизма Asch в 83,3% случаев, когда опыт называли прямо, и в 0% — когда ту же задачу подавали как обычную; препринт не проходил рецензирование, а все числа получил сам автор. Поэтому единая оценка склонности к смещениям может смешивать распознавание знакомого эксперимента, следование инструкции и устойчивый шаблон ответа.

PsyAgentBench разделяет эти причины по нескольким условиям. Модели давали либо классическую задачу из учебника, либо структурно похожую версию с другими словами и сценарием. В одном варианте промпт прямо называл психологический эффект, в другом описывал обычную задачу. Дополнительно модели одной фразой задавали роль с повышенной склонностью соглашаться — это была инструкция, а не проверенное свойство модели.

Результаты не складываются в общую восприимчивость к человеческим смещениям. Эффект якоря исчезал в вопросах с проверяемыми фактами, но почти полностью проявлялся для вымышленных величин, где подсказка оставалась единственным доступным сигналом. Обрамление ответа усиливалось на новом содержании, если эффект называли прямо. Эффект невозвратных затрат устойчиво отсутствовал, а в опыте с распределением между минимальными группами главным результатом стали отказы модели. Смена заданной роли могла убрать, ослабить или развернуть эффект.

Проверка охватила пять психологических парадигм, до трёх семейств моделей с открытыми весами и 41 904 опубликованных прогона; поскольку полный текст получить не удалось, точную методику сверх описанной в абстракте схемы восстановить нельзя. Для испытаний LLM-агентов из этого следует более узкий формат отчёта: вместо одного балла полезнее сохранять профиль по формулировкам, новым вариантам задачи, заданным ролям и отказам. Такой профиль показывает, переносится ли поведение между условиями или возникает только при узнаваемой подсказке.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу