Журнал · Rit.work

Логическая валидность видна внутри LLM, но не управляет ответом

Исследователи обнаружили разрыв между информацией о логической валидности в скрытых состояниях LLM, её выражением в ответе и влиянием на решение.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи University of Minnesota проверили, как LLM представляют логическую валидность, в препринте, который не проходил рецензирования. По замерам авторов, модели отвечали около случайного уровня, хотя валидность почти безошибочно извлекалась из их скрытых состояний. Работа важна командам, которые оценивают рассуждения моделей или используют внутренние признаки для контроля их поведения.

Что сделали

Авторы составили контролируемый набор из 800 примеров: модель получала посылки и утверждение, после чего выбирала между VALID и INVALID. Примеры образовывали пары с одинаковыми посылками, тематикой и сложностью, но разной валидностью утверждения.

На пяти моделях с открытыми весами исследователи отдельно измерили ответы и обучили линейные классификаторы извлекать валидность из скрытых состояний. Качество оценивали по AUROC — вероятности, что классификатор поставит валидный пример выше невалидного; случайному ранжированию соответствует 0,5.

Точность ответов оставалась около 50%, причём некоторые модели почти всегда выбирали одну метку. В то же время AUROC внутренних классификаторов достигал 1,0 и оставался высоким на незнакомых шаблонах, тематиках и многих типах вывода. Однако вмешательство вдоль найденного направления в скрытом состоянии не изменило ни одного бинарного ответа при основной проверенной силе воздействия; случайные направления давали сопоставимые изменения.

Что это значит

Доступный для классификатора признак нельзя автоматически считать способностью модели рассуждать или механизмом, который управляет результатом. Для оценки продукта нужны как минимум три раздельные проверки: качество конечных ответов, наличие нужной информации во внутренних состояниях и причинное влияние этой информации на поведение. Высокое качество внутреннего классификатора подтверждает только второе.

Ограничения. Работа проверяет синтетическую задачу логической верификации на относительно небольших моделях с открытыми весами, работавших с квантованием. Набор охватывает ограниченное число тематик и типов вывода, а анализ использует линейные классификаторы состояния последнего токена запроса. Замеры не показывают, сохраняется ли разрыв в естественных диалогах, длинных контекстах, открытых задачах, более крупных моделях или при нелинейном и распределённом представлении признака. В сравнении авторов также нет более широкого набора архитектур.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу