Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новую политику мультимодальной модерации удалось обучить без единого реального примера нарушения. Zeeshan Ahmed, Yang Qin и Hanqing Huang описали SJR в нерецензированном препринте, где все числа получили сами авторы: система повысила F1 для объявлений без нарушения на 23,6% относительно базовой модели. Частые изменения правил можно перенести в отдельный текстовый классификатор, не переобучая всю мультимодальную систему.
Текст отделяет восприятие контента от правил
Обычный классификатор одновременно разбирает изображение, видео, текст и решает, нарушает ли контент конкретное правило. Изменение политики модерации — набора критериев для решения — затрагивает веса всей модели и требует нового обучения на мультимодальных примерах.
SJR делит эту работу между двумя моделями. Content Model получает исходные материалы и составляет структурированное текстовое описание. В опыте с рекламой она отдельно пересказывает объявление и целевую страницу, чтобы сохранить обещания, предложения и возможные противоречия между ними.
Policy Model видит только это описание и формулировку политики. Она не получает пиксели, звук или исходную страницу, поэтому текст становится единственным интерфейсом между восприятием и решением. Такое описание заодно остаётся доступным для проверки человеком, хотя само по себе не доказывает правильность вердикта.
Простого разделения моделей оказалось недостаточно: вариант без обучения работал примерно как базовый подход. Универсальное описание пропускало детали, от которых зависит решение, поэтому Content Model дополнительно учили выделять признаки, полезные для конкретной политики. Архитектурно компоненты разделены, но после такого обучения первая модель уже не полностью нейтральна к правилам.
Обе модели учатся через текстовый посредник
Обучение идёт по циклу. Content Model сначала создаёт несколько описаний одного материала, затем Policy Model классифицирует каждое. Правильный ответ даёт бинарную награду, после чего алгоритм GRPO усиливает описания, которые помогли принять верное решение. Обновлённые описания используют для следующего обучения Policy Model.
Здесь оценщик не остаётся замороженным: обе модели по очереди приспосабливаются друг к другу. Это отличает SJR от обучения одной модели на собственных удачных ответах и от схем, где награду всегда выдаёт один неизменный классификатор.
Для холодного старта третья модель создаёт варианты текстовых описаний. Она добавляет противоречивые обещания, безобидные перефразировки и пограничные случаи. Поэтому реальные корректные объявления можно превратить в синтетические примеры нарушений, не генерируя правдоподобные поддельные видео или целевые страницы.
После трёх циклов SJR получила F1 79,25% для объявлений без нарушения и 93,73% для нарушений. F1 объединяет точность и полноту в одну оценку. Система обошла сквозное дообучение с учителем (SFT), STaR/RFT и RLFT, причём промежуточный цикл временно ухудшил результат, а лучший баланс появился только в финале.
Вариант без реальных нарушений отстал от обучения на полном наборе лишь на 1,3% для корректных объявлений и на 0,2% для нарушений. Это сильный результат именно для запуска политики: сначала можно собрать проверенные нормальные случаи, а недостающую сторону границы решения построить в текстовом пространстве.
Менять архитектуру стоит ради скорости политик, а не экономии
SJR меняет планы команд, у которых правила обновляются чаще, чем мультимодальная модель. Структурированное описание можно оформить как стабильный контракт: система восприятия извлекает факты, а отдельные Policy Model применяют к ним разные определения нарушений. Новую политику тогда проще обучать и тестировать независимо.
Синтетические нарушения подходят для начального запуска, но не заменяют контроль качества. Их формирует и размечает одна модель дополнения, поэтому ошибки генерации переходят в классификатор. Для производственной системы понадобятся проверки того, что описание не потеряло важный сигнал, а созданные примеры действительно соответствуют границе политики.
Работу проверяли на одной задаче — сопоставлении рекламы с целевой страницей — и на внутреннем наборе данных крупной рекламной платформы. Обобщение на другие виды нарушений, длинные видео или аудио в эксперимент не входило.
Заявленную экономию также пока нельзя закладывать в расчёты. Хотя архитектура предполагает небольшую текстовую Policy Model, в опытах одну и ту же модель использовали для понимания контента, классификации и дополнения данных. Двухступенчатый вывод требует больше вызовов LLM, а снижение стоимости за счёт меньшего классификатора оставили будущей работе.
Поэтому ближайшее практическое применение SJR — не немедленная замена рабочего конвейера, а отдельный слой политик поверх проверенного извлечения фактов. Такой прототип покажет, достаточно ли текстового представления для конкретного продукта и окупает ли более быстрый выпуск правил дополнительные вызовы моделей.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



