Журнал · Rit.work

LLM скрывает авторский стиль без разрушения текста

Новый метод составляет профиль авторского стиля и переписывает текст так, чтобы затруднить повторную идентификацию без резкого ухудшения читаемости.

Rit.work
Студия разработки
14 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Текст научились переписывать так, чтобы классификатор хуже узнавал автора по синтаксису, лексике и пунктуации. Хотя препринт не рецензирован и все числа получили сами авторы, распознавание автора стало заметно слабее, а читаемость осталась близкой к исходной. Для продуктов, которые публикуют пользовательские тексты или обрабатывают расшифровки разговоров, это добавляет практический слой защиты между удалением имени и публикацией.

Как профиль автора превращают в инструкцию для LLM

Удалить имя, адрес и телефон недостаточно: автора могут выдать длина предложений, любимые слова, тон и расстановка знаков препинания. Классификатор учится связывать эти повторяющиеся признаки с конкретным человеком, даже если текст формально обезличен.

Метод Ahmed Sohair Khan, Estrid He, Monica Wachowicz и Elham Naghizade сначала строит понятный человеку профиль стиля. LLM получает пять примеров одного автора и описывает четыре группы признаков: длину текста, выбор слов, тон и пунктуацию.

Затем та же LLM переписывает новый текст, подавляя признаки из профиля, но сохраняя содержание. Метод не получает доступ к атакующему классификатору и не подбирает текст под его ошибки. Это отличает его от защиты, которая оптимизируется против заранее известной модели распознавания.

Авторы отдельно сравнили полный профиль, профиль с одним признаком, нейтральное переписывание без явного профиля и обычный парафраз. На коротких отзывах одна длина предложений почти обеспечила тот же компромисс, что и полный профиль. На более разнообразных блогах ни один признак не оказался устойчиво главным, поэтому полный профиль работал стабильнее.

Проверка охватила два набора данных: длинные записи из Author10 и короткие отзывы Illinois9. Для построения профилей и переписывания использовали Llama-3.2-3B-Instruct и MiniCPM3-4B. Классификаторы обучали на исходных текстах, а затем пытались определить авторов переписанных версий; дополнительный опыт также позволял атакующей стороне переобучиться на анонимизированных данных.

Где проходит компромисс между приватностью и качеством

На Author10 F1-мера распознавания автора снизилась с 66,45 до 26,02. F1-мера объединяет полноту и точность классификатора: чем она ниже в этом опыте, тем хуже модель связывает переписанный текст с исходным автором.

Читаемость оценивали через перплексию — показатель того, насколько естественно языковая модель воспринимает последовательность слов. У исходных блогов она составляла 41, у переписанных — 42,47, то есть почти не изменилась. Самый строгий вариант дифференциальной приватности сильнее скрывал автора, но поднял перплексию до 8770: текст становился значительно менее естественным.

Одной смысловой близости для такой проверки недостаточно. Переписывание может оставить общую тему, но потерять редкие имена, термины и отдельные факты. Поэтому работу также оценивали по сохранению информативных слов и показывали тексты моделью-оценщиком.

В одном примере исходная запись обсуждала статью, продолжала прежнюю тему и просила предложить оформление блога. Вариант с дифференциальной приватностью свёл её к просьбе об оформлении. Переписывание по стилевому профилю сохранило все три смысловые части, но классификатор уже не связал текст с автором.

При этом явный профиль не всегда давал минимальную F1-меру в каждой отдельной конфигурации. Его преимущество проявилось в совокупности: он ослаблял распознавание, сохранял связность и реже выбрасывал информативные части текста. Обычный парафраз менял формулировки, но оставлял больше авторского сигнала.

Меняет ли метод планы продуктовых команд

Работа предлагает не новый формальный стандарт анонимности, а пригодный для прототипа этап обработки текста. Его можно поставить после удаления явных идентификаторов и перед публикацией отзывов, сообщений сообщества, исследовательских корпусов или внутренних расшифровок.

Дифференциальная приватность даёт математически сформулированную гарантию при заданной модели угроз. Переписывание по профилю такой гарантии не даёт, поэтому оно не заменяет обязательные меры там, где уровень защиты задан договором или регулированием. Зато оно может лучше сохранять рабочую ценность текста, когда сильное добавление шума делает результат непригодным.

Для внедрения нужен набор прежних текстов каждого автора: именно из него система извлекает устойчивые привычки. Поэтому схема подходит для площадок, где пользователь пишет регулярно, но из этой работы нельзя заключить, что она так же справится с одиночным сообщением неизвестного человека.

Проверяли письменные блоги и отзывы. Расшифровки звонков и встреч названы важным применением, однако в эксперименты они не вошли. Метод также работает только с текстовым стилем и не скрывает автора по времени публикации, геолокации или другим сопутствующим данным.

Практический пилот стоит проверять на собственном классификаторе авторства и на важных для продукта сущностях: именах компаний, артикулах, медицинских терминах, суммах. Главный результат работы не в том, что LLM гарантирует анонимность, а в том, что целевое подавление стилевых признаков выглядит полезнее случайного искажения всего текста.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу