Журнал · Rit.work

LLM-прогнозы принимают повторение новости за подтверждение

Подложные новости сдвигают вероятности в системах прогнозирования, а фильтры источников, релевантности и машинного текста не устраняют атаку.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Публикации в открытом новостном корпусе могут систематически менять вероятностный прогноз LLM, даже если атакующий не знает модель, поисковые запросы и устройство системы. В препринте Yuan Lu и Yukuan Zhang, который не прошёл рецензирование и приводит замеры самих авторов, одна подложная статья перевела 56% прогнозов через порог 0,5, а пять статей — до 73%. Значит, защищать нужно не только модель и её API, но и весь путь новости до контекста.

Авторы исследовали системы, которые ищут новости, отбирают релевантные материалы и на их основе оценивают вероятность события — поиск с дополнением ответа найденными материалами (RAG). Для каждого вопроса они создавали правдоподобные статьи, которые поддерживали нужный исход, но не упоминали сам прогноз или рынок. Статьи не подгоняли под поисковый механизм: атакующему достаточно опубликовать текст, который затем попадёт в индекс.

Наиболее точная из проверенных конфигураций оказалась и наиболее уязвимой. Пять статей увеличили долю подложных материалов среди прошедших строгий фильтр, а оценка Брайера — средняя квадратичная ошибка вероятностей, где меньше значит лучше, — ухудшилась с 0,184 до 0,372. Фильтр удалял обычные новости быстрее, чем специально написанные релевантные тексты.

Проверка охватила 500 завершённых вопросов ForecastBench, корпус Common Crawl News из 17,4 млн материалов и три системы на открытых моделях Qwen и Hermes. Новости отсекали по дате обхода сайта, чтобы модель не увидела факты из будущего. Подложные статьи добавляли в локальную копию корпуса, поэтому эксперимент измеряет эффект после индексации, а не вероятность того, что конкретный поисковый робот найдёт публикацию.

Три естественные защиты не решили проблему. Список разрешённых издателей работал, пока атакующий не подменял метку источника; отдельная обработка документов ломалась, когда подложные статьи составляли большинство; фильтр машинного текста обходился изменением режима генерации. Практический вывод для архитектуры — проверять происхождение материалов вне модели, искать подтверждения у независимых источников и увеличивать неопределённость прогноза при расхождении свидетельств.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу