Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Часть прироста качества у настраиваемых после обучения OOD-детекторов возникает потому, что они узнают конкретный проверочный датасет, а не новые данные. При самой гибкой настройке на ImageNet три четверти прибавки исчезли после смены источника; работа Donghoon Lee и Shinjin Kang не рецензирована, и числа в ней получили сами авторы. Командам, которые подбирают детектор на известных аномалиях, стоит разделять качество на знакомом источнике и перенос на новый.
Почему разделение изображений не проверяет перенос
Детектор данных вне обучающего распределения (OOD) читает внутренние признаки готового классификатора и выдаёт оценку новизны. Сам классификатор при этом не переобучают, но детектор может подобрать константу, направление в пространстве признаков или более гибкое правило по обычным и аномальным изображениям.
Типичный тест делит один OOD-датасет на части: по одной детектор настраивают, по другой считают качество. Такое разделение показывает, что правило не запомнило отдельные изображения. Однако обе части сохраняют общие особенности источника — набор классов, способ съёмки и структуру признаков.
Правило может научиться отличать этот датасет от обучающих данных и успешно пройти проверку. В эксплуатации оно встретит аномалии из другого источника, поэтому узнавание датасета перестанет помогать.
Для проверки переноса авторы оставляли целиком один OOD-датасет, настраивали детектор на остальных и только затем оценивали его на исключённом источнике. Обычный и новый протокол использовали одинаковые обучающие и проверочные изображения; различался только OOD-датасет, доступный во время настройки. Разницу между результатами назвали инфляцией качества.
Нулевой точкой служил VarRatio — детектор без настройки на OOD-данных. Он сопоставляет расстояние до ближайшего класса с разбросом расстояний до всех классов. Качество измеряли через AUROC: эта метрика показывает, как часто случайная аномалия получает более высокий балл новизны, чем обычный пример.
Проверка охватила 11 готовых моделей для ImageNet и 6 архитектур для CIFAR-100, каждую из которых обучили с 3 начальными состояниями. Сравнивали подбор одной константы, линейные комбинации признаков и нейросеть, которая объединяет несколько сигналов детектора. Поэтому вывод относится к OOD-детекторам поверх классификаторов изображений и к настройке на аномалиях из benchmark-датасетов.
Ёмкость правила увеличила отчётный результат, но не перенос
По мере того как детектор получал больше направлений в пространстве признаков, обычная оценка росла быстрее результата на исключённом датасете. На CIFAR-100 разрыв возникал на каждом шаге и был больше, чем на ImageNet. В наиболее гибком варианте обычная оценка продолжала улучшаться, хотя перенос на новый источник ухудшался.
Причиной оказалась не просто сложность модели. При одном и том же наборе из 13 входных сигналов число параметров увеличили до 540 000. Инфляция выросла на 1,61 пункта AUROC, а результат на исключённом источнике изменился на −0,34 пункта. Дополнительная ёмкость почти целиком улучшала распознавание знакомого датасета.
Два контрольных опыта связали эффект с идентичностью классов. В первом детектор получал одинаковый набор расстояний до классов, но в одном случае значения сортировали и тем самым скрывали, какому классу принадлежит каждое расстояние. Несортированный вариант завышал качество сильнее на каждой проверенной базовой модели.
Во втором опыте сравнивали одинаково широкие представления. Направления, которые сохраняли сведения о конкретном классе, давали большую инфляцию, чем признаки, нечувствительные к перестановке классов. Значит, детектор использовал не только общий сигнал новизны, но и характерное положение датасета относительно известных классов.
Подбор одной константы на отдельном валидационном датасете не показал инфляции на обоих benchmark-наборах. Проблема начиналась, когда правило получало больше свободы: учило несколько весов, направление или нелинейную комбинацию. Настройка той же константы непосредственно на целевом источнике уже давала разрыв.
В планах стоит менять проверку, а не отказываться от OOD-детекции
Работа не требует заменять готовый классификатор или исключать настройку детектора. Она меняет критерий, по которому команда выбирает правило: разделения изображений внутри одного источника недостаточно, если будущие аномалии придут из других систем, камер или наборов классов.
Практический протокол можно свести к трём действиям:
- собрать несколько независимых источников аномалий, а не смешивать их в один набор;
- по очереди целиком исключать каждый источник из настройки;
- показывать отдельно качество на знакомом источнике и результат, который пережил его замену.
Если доступен только один OOD-датасет, сложный обучаемый объединитель нельзя оценить на перенос этим способом. В таком случае безопаснее сохранить правило с минимальной свободой или считать прибавку результатом для конкретного источника, а не общей способностью находить новое.
Авторы также вывели способ заранее оценить риск инфляции по данным настройки. Он учитывает, насколько далеко конкретный OOD-источник смещён в пространстве признаков и насколько его направление совпадает с общим направлением остальных источников. Такой расчёт помогает отсеять правила, которые явно цепляются за идентичность датасета, но не заменяет проверку на полностью исключённом источнике.
Для продуктового плана главный вывод узкий: простой параметр, выбранный на отдельном валидационном источнике, в этих опытах перенёсся, а более гибкий детектор потребовал проверки по целым датасетам. Без неё рост AUROC может описывать знакомство с тестовым набором, а не устойчивость системы к новым данным.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



