Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Проверку галлюцинаций в изображениях, видео и аудио свели в один контур, который работает и для описания медиа, и для генерации по тексту. Jianjiang Yang и коллеги сократили число обращений к экспертным моделям на 66%; поскольку препринт не рецензирован, все числа в нём получили сами авторы. Для продуктовой команды это схема, как пропускать простые случаи через дешёвый фильтр, а спорные отправлять на полную проверку.
Как ответ превращают в проверяемые утверждения
OmniHallu ищет галлюцинации — утверждения, которые противоречат исходным данным или не подтверждаются ими. Один и тот же принцип применяют в обе стороны: проверяют текстовое описание изображения, видео или аудио, а также сверяют с текстовым запросом сгенерированное изображение, ролик или звук.
Сначала языковая модель раскладывает текст на самостоятельные утверждения. Фразу о человеке, который берёт чашку со стола после звонка, система разделит на объекты, действие, расположение и порядок событий. Благодаря этому она ставит метку не всему ответу сразу, а конкретной детали.
Дальше утверждения получают специализированные эксперты. Для изображений система подключает детектор объектов и зрительно-языковые модели, для видео ищет доказательства в отдельных временных отрезках, для аудио сопоставляет акустические признаки. Финальная модель объединяет решения, пояснения и сигналы уверенности, а не просто принимает большинство голосов.
Ошибки делят на четыре общих типа: выдуманный объект, неверный признак, неправильная связь и искажённое событие. Такая схема позволяет использовать один формат результата во всём продукте, хотя инструменты проверки под каждой модальностью остаются разными.
Отдельный обучаемый верификатор повторяет решения полного контура. Его обучают методом GRPO: модель сравнивает несколько собственных ответов внутри группы и получает награду за совпадение с разметкой, согласие с экспертами и осторожность при противоречивых сигналах. Уверенные решения проходят без дополнительных вызовов, а неоднозначные возвращаются экспертному ансамблю.
Единый протокол помогает, но не выравнивает модальности
Проверку провели на OmniHallu-Bench из 10 000 образцов. Набор охватывает шесть направлений между текстом, изображениями, видео и аудио; в него вошли отобранные людьми и сгенерированные примеры, проверенные разметчиками. Сравнение шло с самопроверкой одной модели во всех задачах и с UNIHD там, где тот поддерживает изображения.
Основная метрика — макроусреднённая F1, которая усредняет качество по классам «галлюцинация» и «корректное утверждение», поэтому частый класс не скрывает ошибки на редком. OmniHallu обошёл сильнейший доступный базовый метод на 3,4–8,1 пункта в зависимости от задачи; разница статистически значима. Однако в главном сравнении новый контур использовал более сильную модель рассуждения, чем часть базовых решений.
Контрольный запуск с одинаковой моделью сохранил преимущество на видео и аудио, но сократил его до 1,3–1,9 пункта. Это отделяет пользу архитектуры от вклада более сильной базовой модели и показывает, что крупный разрыв из основной таблицы нельзя целиком приписать разбиению на утверждения и ансамблю.
Лучше всего система справлялась с изображениями, хуже — с видео, ещё хуже — со звуком. Объекты проверять проще, чем связи между ними: детектор может найти чашку, но порядок действий или причинную связь приходится восстанавливать по нескольким фрагментам. В аудио эксперты чаще разделяют одну и ту же ошибку из-за неоднозначных звуков и слабого разделения источников, а голосование не исправляет общий слепой участок.
Когда фильтр меняет архитектуру продукта
Работа предлагает не готовый универсальный защитный слой, а полезную архитектурную границу. Вместо проверки каждого результата несколькими крупными моделями команда может поставить перед ними компактный маршрутизатор: очевидные случаи закрывать сразу, сомнительные передавать дорогому контуру, а итог хранить вместе с проверенными утверждениями и доказательствами.
Полная проверка оценена примерно в 0,12 доллара и 15 секунд на образец. С обученным фильтром расчётная стоимость падает до 0,05 доллара, а задержка — до 6 секунд. Такой режим уже ближе к фоновой проверке пользовательского контента или контролю пакетной генерации, хотя для синхронного интерфейса задержка всё ещё заметна.
Планы стоит менять командам, которые сейчас выбирают между одной дешёвой самопроверкой и постоянным ансамблем. OmniHallu добавляет промежуточный вариант: обучить верификатор на собственных примерах и эскалировать только неуверенные решения. При этом качество будет зависеть от моделей для конкретной модальности, а общие ошибки экспертов останутся незамеченными.
Проверяли только пары, где одной стороной служит текст, а другой — изображение, видео или аудио. Поэтому перенос на преобразования между двумя нетекстовыми форматами потребует другой схемы разбиения результата. В сценариях, где ошибка влияет на безопасность или права человека, контур остаётся фильтром перед проверкой специалистом, а не её заменой.
Источники
Иллюстрация: рисунок из статьи «OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models», Jianjiang Yang, Peihang Li, Shanqing Xu и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



