Журнал · Rit.work

Верифицированная запись не убеждает LLM, что источник награды честен

Эксперимент показал, что LLM уверенно замечают ложные отчёты о награде, но могут отвергнуть исправный источник из-за несущественных деталей задания.

Rit.work
Студия разработки
16 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM гораздо легче распознаёт испорченный канал награды, чем подтверждает исправность честного. В нерецензированном препринте, где числа получил сам автор, Qwen2.5-72B-Instruct безошибочно распознала лживый источник, однако при неизменной среде ошибочно обвинила честный в 38% случаев. Одиночную проверку поэтому нельзя считать надёжным предохранителем для агента, который меняет поведение после такого диагноза.

В эксперименте агент выбирал между вариантами и получал отчёты о награде. Изменение выплат и ложь источника создавали полностью одинаковую историю, поэтому различить их по дальнейшим наблюдениям было невозможно. В запрос добавляли одну верифицированную запись: реальный результат отдельного хода рядом с отчётом источника.

Этой строки логически хватало для однозначного ответа. Модель без дополнительного обучения должна была одним символом назвать источник честным или лживым, без случайной выборки и записанного рассуждения. Qwen2.5-72B-Instruct обнаруживала ложь в 100% двух проверенных сценариев, но при реальном изменении выплат называла честный источник лжецом уже в 58% случаев. Этот сценарий хуже прошёл контроль чтения, поэтому основной вывод держится на результате с неизменной средой.

Ошибка зависела от деталей, которые не несли сведений об источнике. На ответы Qwen влиял ход, к которому относилась запись, а на Llama — буква, назначенная варианту «честный». Контрольные запросы с напечатанным ответом показали, что проблема возникала не только из-за непонимания правил: добавление подтверждающей записи иногда даже снижало вероятность правильного ответа Llama.

Проверка охватила три модели семейств Qwen2.5 и Llama-3.1 на 64 искусственных мирах с несколькими формулировками. Модели отвечали за один шаг, поэтому результат не показывает, как изменится точность при развёрнутом рассуждении. Для систем, которые сверяют награды или показания инструментов, практический вывод уже виден: подтверждающая запись помогает находить сбой, но не гарантирует, что исправный канал останется в работе.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу