Журнал · Rit.work

Научный текст ИИ выдаёт не стиль, а разрывы в рассуждении

SciSlopBench отличает созданные ИИ статьи по разрывам между тезисами, доказательствами и иллюстрациями, а SciSlopHarness исправляет текст только с опорой на результаты экспериментов.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Научные тексты, созданные ИИ, научились отличать по разрывам в рассуждении, даже если отдельные разделы выглядят убедительно. В работе, которая не прошла рецензирование и содержит замеры самих авторов, набор таких признаков дал точность 85,9% против 68,7% у детектора Binoculars. Для систем, которые генерируют статьи и отчёты, отсюда следует практическое правило: проверять нужно связи между утверждениями и данными, а не только стиль текста.

Шесть признаков проверяют статью целиком

Авторы называют научным мусором повторяющиеся разрывы между частями исследования. Детектор на уровне слов может не заметить их: введение, таблица и вывод по отдельности выглядят правдоподобно, но таблица не подтверждает вывод, а введение не подводит к главному тезису.

SciSlopBench оценивает шесть признаков в трёх группах:

  • Структура. Система ищет объекты, на которые не ссылаются за пределами их раздела, и фрагменты, которые повторяют предыдущие разделы вместо развития мысли.
  • Аргументация. Она проверяет, подготовлены ли ключевые тезисы предшествующим рассуждением и объясняет ли текст роль цитируемых работ. Изолированная ссылка не показывает, что именно статья заимствует, оспаривает или сравнивает.
  • Материалы. Система отмечает схемы метода, перегруженные сведениями об экспериментах и результатах, а также статьи с итоговыми таблицами, но без конкретных входных данных, выходов или разобранных случаев.

Каждый показатель выражает долю проблемных элементов среди всех элементов нужного типа. Это не классификатор авторства по словарю или вероятностям токенов, а формальная проверка того, как разделы, тезисы, ссылки, схемы и примеры поддерживают друг друга.

SciSlopBench сравнивает работы попарно

В SciSlopBench вошли 390 текстов, созданных системами FARS и Agents4Science, и столько же работ людей. Для каждой пары совпадают исследовательская задача и тип вклада: например, новый метод сравнивают с новым методом, а не с обзором. Человеческие работы приняли ведущие конференции, поэтому проверка отчасти разделяет не только происхождение, но и качество готового результата.

Парная точность показывает, как часто оценка правильно выбирает созданную ИИ статью из согласованной пары. Набор признаков SciSlopBench достиг 85,9%, а Binoculars, который опирается на вероятности текста, — 68,7%. Полнотекстовые модели-рецензенты также не превзошли токеновый детектор, хотя получали статью целиком.

Более высокий показатель научного мусора совпадал с более низкими оценками рецензентов ICLR и отделял отклонённые статьи от принятых во всех проверенных выпусках конференции. Но эти признаки не доказывают, кто написал текст и нарушал ли автор правила: они указывают на дефекты рассуждения, которые встречаются и в человеческих работах.

Границы проверки задаёт сам набор: тексты взяты из двух систем, большинство относится к компьютерным наукам, хотя представлены также естественные, социальные и медико-биологические дисциплины. Поэтому полученную точность нельзя без нового теста переносить на другие генераторы, внутренние технические отчёты или заявки.

Исправление по метрике портит содержание

Прямая команда снизить показатели научного мусора приводит к подгонке под метрику. Редактор может удалить повтор вместе с нужными ссылками или расставить формальные отсылки к таблицам, не объяснив, как данные поддерживают тезис. Оценка улучшается, а научная связь остаётся сломанной.

SciSlopHarness разделяет поиск дефекта, правку и проверку. Система указывает редактору место разрыва, после чего отдельная модель сверяет каждое изменение с исходной рукописью, результатами экспериментов и кодом. Неподтверждённый абзац возвращается к предыдущей версии; цикл продолжается не более трёх раундов.

В одном примере обычная правка убрала повтор вместе с четырьмя ссылками на предшествующие работы. SciSlopHarness сохранил ссылки и удалил только дублирование. В другом случае система добавила отсылку к таблице лишь там, где она действительно подтверждала устойчивость метода, и прямо связала наблюдение с выводом.

По сравнению с сильнейшим базовым способом редактирования SciSlopHarness сократил оставшийся разрыв между текстами ИИ и людей на 63%. Человеческие образцы при правке не использовались: допустимость изменений определяли записи самого эксперимента.

Для команды, которая строит генератор исследовательских материалов, работа меняет не выбор модели, а устройство контура проверки. Одного запроса «улучши статью» или оптимизации оценки недостаточно. Нужны локальные замечания, доступ к исходным данным и коду, а также проверка каждого добавленного утверждения до сохранения правки.

Источники

Иллюстрация: рисунок из статьи «Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers», Yerim Oh, Young-Jun Lee, Jaewoo Ahn и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу