Журнал · Rit.work

Отказ меняет следующий ответ LLM по-разному у разных семейств

Эксперимент с последовательными запросами показал противоположное изменение соблюдения инструкций у моделей Anthropic, OpenAI и Google.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Til Jordan проверил, переносится ли на LLM техника «дверью по лицу»: сначала модель отклоняет завышенную просьбу, затем получает её смягчённую версию; работа опубликована как препринт, не проходивший рецензирования. По замерам автора, Opus 5 выполнял меньшую просьбу в 65,8% случаев после отказа против 29,3% при прямом запросе. Результат важен разработчикам диалоговых систем и испытаний безопасности: предыдущий отказ может изменить следующий ответ, но направление эффекта зависит от семейства модели.

Что сделали

Каждый опыт начинался с новой беседы и заканчивался одной и той же целевой просьбой. Автор сравнивал прямой запрос с несколькими вариантами контекста: отказом на более широкую просьбу по той же теме, ответом на нейтральный вопрос и отказом по другой теме. Ответы независимо оценивали две модели других поставщиков; выполнением считался только случай, когда обе модели-оценщика соглашались с этой меткой.

Основной набор включал 60 англоязычных просьб вынести отрицательное суждение о классе реальных организаций. На моделях Anthropic техника повысила соблюдение для Opus 5, Opus 4.5, Opus 4.8 и Sonnet 5. Для Haiku 4.5, GPT-5.6 sol и Gemini 3.1 Pro эффект был обратным, а у GPT-5 mini и Gemini 3 Flash различие оказалось в пределах погрешности. Отказ по связанной теме влиял сильнее несвязанного отказа во всех проверенных моделях.

Что это значит

Результат не позволяет считать человеческую технику влияния универсальным свойством LLM. При проектировании многошаговых диалогов нужно испытывать не только отдельный запрос, но и состояние беседы после отказа: одинаковая последовательность может повысить соблюдение у одного семейства и снизить у другого. Это относится и к оценке защитных механизмов, и к обычным сценариям, где пользователь уточняет отклонённую просьбу.

Ограничения. Главный эффект измерен на одном шаблонном семействе английских запросов, поэтому работа не показывает его переносимость на другие языки и задачи. Дополнительная проверка на 399 сочетаниях модели и отказа из публичных наборов не обнаружила такого повышения соблюдения. Большинство конечных точек API не были закреплены по версии, поэтому замеры описывают развёртывания августа 2026 года. Причину различий автор выводит только из поведения моделей; сравнения с доступом к внутренним состояниям или весам в работе нет.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу