Журнал · Rit.work

Текстовый детектор ИИ нельзя делать фильтром доверия к постам о бедствиях

Детекторы почти не распознают сгенерированные сообщения о бедствиях, а адаптация к теме заставляет их реагировать на стиль вместо происхождения текста.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Происхождение постов о бедствиях нельзя надёжно установить только по их тексту. В нерецензированном препринте, где все числа получены самими авторами, лучший заранее настроенный фильтр распознал 3,6% сгенерированных сообщений. Такой детектор нельзя ставить перед системой мониторинга как автоматический фильтр для оперативной сводки.

Xiaoshan Zhou и Zaifu Zhan собрали 12 000 текстов о девяти бедствиях. В корпус вошли исходные человеческие посты, их минимально отредактированные с помощью LLM версии, созданные ИИ сообщения на основе тех же проверенных фактов и их эмоционально окрашенные варианты. Отдельный корпус использовали, чтобы выбрать модели и настроить пороги срабатывания.

Авторы проверили OSM-Det, Fast-DetectGPT, Binoculars и модели-оценщики из пяти семейств. Площадь под ROC-кривой (AUROC) показывает, насколько хорошо классификатор разделяет два класса при разных порогах: значение 0,5 соответствует случайному угадыванию. У конфигураций, которые переносили между семействами моделей без дополнительного обучения, результат составил от 0,402 до 0,517 — практически случайный уровень.

Адаптация к тематике бедствий подняла AUROC линейного классификатора поверх кодировщика с неизменяемыми весами до 0,817. Однако после устранения найденных различий в поверхностных признаках текста показатель снизился до 0,594. Классификатор также различал нейтральные и эмоциональные версии одних и тех же сгенерированных сообщений, хотя их происхождение не менялось. Это указывает, что модель распознавала стиль и устройство набора данных, а не сам факт генерации.

Вывод относится к текстовым сообщениям в собранных корпусах и к перечисленным детекторам. Поскольку полный текст работы получить не удалось, границы проверки и детали методики здесь приведены только в той мере, в какой их раскрывает абстракт. Для систем мониторинга остаётся опираться на контекст, проверяемые источники и подтверждения из других форматов, а не на один балл текстового детектора.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу