Журнал · Rit.work

Фактическая проверка LLM пропускает ошибки в последующих решениях

Эксперимент показал разрыв между ответом LLM на прямой вопрос и решением, которое система принимает на основе того же факта.

Rit.work
Студия разработки
5 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Правильный ответ LLM на проверочный вопрос не гарантирует, что система верно применит тот же факт в следующей задаче. В работе Lin Tian и Marian-Andrei Rizoiu прямой тест выбирал внедрённую ложь в 95,8–100% случаев, тогда как её доля в решениях росла лишь на 1,7–14,4 процентного пункта; эти числа получили сами авторы в препринте, который не проходил рецензирование. Поэтому проверять систему только вопросами на знание фактов недостаточно: тест должен доходить до итогового действия.

Модели дополнительно обучали на документах с ложными столицами стран, не добавляя в запрос специальный сигнал. Затем модель отвечала на несколько вопросов о расположении столицы среди карточек, а фиксированный алгоритм превращал ответы в выбор карточки. В обучающих данных игры не было, поэтому эксперимент отделял запомненный факт от способа принять решение.

Прямой тест и игра расходились в обе стороны. Модель могла уверенно предпочитать ложную столицу, но редко выбирать её в игре; могла правильно назвать столицу, но всё равно сдвигать решение к ложному варианту. После обучения на правдивых исправлениях фактический ответ восстанавливался раньше, чем построенные на нём решения.

Проверка охватывала восемь моделей семейств Qwen, Llama, Gemma и Kimi, обученных на 1000 целевых утверждений для каждого факта. Их сравнивали с моделями, которые при тех же настройках получали правдивые документы. Отдельно авторы разобрали публикации о лесных пожарах в Австралии: ложные посты превращали 183 человека, столкнувшихся с юридическими мерами, в арестованных за поджог, хотя обвинения относились к 24 людям. После обучения на таких постах модель сохраняла историю об арестах за поджог, даже когда переставала воспроизводить завышенное число.

Источники

Иллюстрация: рисунок из статьи «Misinformation Without Triggers: From Factual Answers to Downstream Decisions», Lin Tian, Marian-Andrei Rizoiu, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу