Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Детекторы LLM-текста могут почти перестать распознавать переписанные научные аннотации после смены поколения моделей. Хотя препринт не рецензирован и все числа получили сами авторы, результат резкий: детектор, обученный на прежних версиях одного поставщика, находил свыше 99% переписанных текстов перед самым сильным переходом и лишь 3,8% после него. Значит, точность такой проверки нельзя считать постоянным свойством продукта: её придётся подтверждать после каждого заметного обновления моделей.
Kazuki Nakajima и Takayuki Mizuno взяли научные аннотации, опубликованные до появления ChatGPT, и переписали их с помощью 23 версий моделей OpenAI, Meta и Alibaba. Затем они сравнили несколько режимов поддержки детектора: обучение на текущей версии, немедленное добавление каждой новой версии, обучение только на прошлых версиях и полностью замороженный классификатор.
Провалы возникали не после каждого обновления, а на отдельных границах поколений — прежде всего при переходах к GPT-5 и Muse-Glimmer. Модели начинали иначе распределять слова, и чем сильнее различался словарь двух версий, тем хуже детектор переносился с одной на другую. При этом смена архитектуры сама по себе не всегда ломала распознавание: переходы к Qwen3 и Llama 4 детекторы выдержали.
Объединение детекторов не устранило проблему, а перераспределило ошибки. Если запускать отдельный классификатор для каждой версии и считать срабатыванием любой положительный результат, система ошибочно помечает примерно одну из восьми человеческих аннотаций. Единый классификатор, обученный сразу на всех версиях, реже обвиняет авторов, но пропускает около трети текстов, переписанных новейшей моделью.
Проверка охватывала аннотации PNAS из медицинских, биологических, физических и общественных наук, а также обученные авторами классификаторы и один коммерческий детектор. Коммерческий продукт повторил основной рисунок: почти не отмечал человеческие тексты, но пропускал большинство переписанных аннотаций сразу после самой резкой границы поколений. Для редакций и платформ практический вывод один: тест на фиксированном наборе LLM быстро устаревает, а обновлять нужно не только модель детектора, но и набор версий, на которых его проверяют.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



