Журнал · Rit.work

Давление LLM-агентов обрушило покрытие конформного сертификата

Ошибочное мнение соседних LLM снизило покрытие конформного сертификата, хотя вопросы не менялись и калибровка модели оставалась прежней.

Rit.work
Студия разработки
7 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Единодушные ошибочные ответы соседних LLM могут лишить силы гарантию, которую модель получила при работе в одиночку. В препринте Illinois Institute of Technology, который не прошёл рецензирование и содержит замеры самих авторов, доля вопросов, где набор вариантов включал правильный ответ, упала с 90% до 74%. Значит, калибровка без переписки агентов не подтверждает надёжность той же модели внутри мультиагентной системы.

Hu и Su исследовали конформное предсказание — способ подобрать набор допустимых ответов так, чтобы правильный вариант попадал в него с заданной вероятностью. Для набора использовали LAC: правило оставляет ответы, вероятность которых превышает откалиброванный порог. Порог вычисляли по ответам модели в одиночку, а при проверке оставляли вопрос прежним и добавляли сфабрикованную переписку, где все собеседники выбирали один неверный вариант.

Контекст снижал оценку правильного ответа, и тот выпадал из набора. Это сдвиг механизма оценки: меняются не входные вопросы, а способ, которым модель превращает их в вероятности после чтения чужих реплик. Поэтому обычные поправки на изменение распределения вопросов не устраняют сбой.

Среднее скрывало более резкий провал. В пограничной группе вопросов, которые сертификат ещё покрывал при низкой уверенности модели, покрытие снизилось с 87% до 47%. На некоторых примерах набор сжимался до единственного неверного ответа, поэтому слой управления действовал автоматически вместо передачи спорного случая человеку.

Основные цифры получили на четырёх открытых моделях в ARC-Challenge и TruthfulQA; часть запусков охватывала дополнительные модели и типы задач. Сравнивали одиночный режим с несколькими вариантами переписки, а устойчивый провал возникал именно при единодушном неверном ответе собеседников. Масштаб эффекта различался между моделями, поэтому работа не доказывает одинаковую уязвимость любых LLM.

Калибровка на примерах с давлением возвращала покрытие, но расширяла наборы ответов, из-за чего система передавала человеку почти все решения. При проектировании мультиагентной архитектуры коммуникационный канал придётся включать в модель угроз и проверять отдельно: сертификат для одиночной модели нельзя без повторной проверки переносить на агента, который читает чужие ответы.

Источники

Иллюстрация: рисунок из статьи «Conformity Breaks Conformal Prediction», Yibo Hu, Hanyu Su, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу