Журнал · Rit.work

FDC исправляет выбор задачи в моделях с последовательным добавлением классов

FDC калибрует выбор классификационной головы по распределению признаков и улучшает точность без отдельного маршрутизатора и повторного обучения модели.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Выбор нужной задачи в модели с последовательным добавлением классов можно исправить после обучения, не меняя её веса и не обучая отдельный маршрутизатор. FDC повысил итоговую точность в среднем на 4,39 процентного пункта во всех 40 сочетаниях метода и набора данных, хотя работа пока не рецензирована, а числа получили сами авторы. Для команд это переносит часть работы с этапа обучения на калибровку уже построенной системы.

Ошибка возникает между классификационными головами

При последовательном обучении модель получает новые группы классов по отдельности. Для каждой группы она создаёт компактное обновление LoRA и классификационную голову, а общий кодировщик превращает входное изображение в набор признаков.

На проверке модель не знает, к какой группе относится изображение. Она сравнивает ответы всех голов и выбирает класс с наибольшей оценкой. Маршрутизация задачи здесь означает выбор головы, внутри которой следует искать правильный класс.

Каждая голова училась отличать только классы своей группы. Она не видела классы из других задач как отрицательные примеры, поэтому может уверенно ответить на чужое изображение. Простое выравнивание средних значений и масштаба оценок не дало устойчивого улучшения: причина лежит не только в несопоставимых числах на выходе.

Если модели заранее сообщить правильную задачу, она исправляет около 80% ошибок. Значит, общий кодировщик часто сохраняет нужные признаки, а итог портит конкуренция между головами. Это отличает проблему маршрутизации от катастрофического забывания, при котором модель теряет ранее усвоенные знания.

Как FDC проверяет признаки на трёх уровнях

Калибровка распределения признаков (Feature Distribution Calibration, FDC) сохраняет исходные классификаторы и дополняет их оценки тремя сигналами. Они проверяют, насколько вход похож на данные, на которых училась каждая задача.

Фильтрация подпространства задачи. Для каждой задачи FDC строит главные направления, в которых менялись её обучающие признаки. Компоненты за пределами этого подпространства ослабляются перед вычислением оценки головы. Такие компоненты почти не помогают на своих данных, но могут необоснованно повышать ответ на чужих.

Калибровка по остатку. После проекции часть признака остаётся вне подпространства. FDC сравнивает величину этого остатка с распределениями для своих и чужих данных. Если остаток больше похож на чужой, оценка соответствующей головы снижается; если он типичен для задачи, повышается.

Близость к прототипу класса. Для каждого класса сохраняется средний нормализованный признак. FDC находит ближайший прототип и проверяет, насколько такая близость обычна для выбранной задачи. Классовые прототипы сохраняют различия, которые исчезают, если усреднить всю задачу в одну точку.

Калибровку можно считать одновременно по признакам исходного замороженного кодировщика и по признакам адаптированной модели. Итоговая оценка складывается из ответа головы, поправки за остаток и близости к прототипу. Градиентные обновления и буфер со старыми примерами во время вывода не нужны.

Проверка охватила пять наборов изображений, включая CIFAR-100, ImageNet-A, ImageNet-R, CUB-200 и OmniBenchmark. Во всех опытах использовали общий кодировщик ViT-B/16, фиксированный порядок классов и методы, где несколько голов работают поверх одного адаптированного кодировщика. На системы с отдельными экспертами и независимыми подсетями результат напрямую не переносится.

Когда FDC меняет план разработки

FDC имеет смысл рассматривать, если модель уже хорошо различает классы внутри известной группы, но ошибается при выборе между группами. В таком случае дополнительное обучение кодировщика может лечить не ту часть системы: сначала стоит измерить разрыв между обычной проверкой и проверкой с известной задачей.

При одной конфигурации компонентов для каждого базового метода FDC улучшил все 40 сочетаний метода и набора данных в среднем на 4,39 процентного пункта. Если включать весь набор компонентов без отбора, улучшение сохранилось в 35 из 40 случаев, а средний прирост составил 4,45 пункта. Значит, эффект не зависит от тонкой настройки под каждый набор, но отдельные компоненты иногда мешают конкретной модели.

Архитектурный выигрыш состоит в том, что не появляется ещё одна обучаемая модель, ошибку которой пришлось бы контролировать. Вместо неё система хранит главные подпространства задач, статистику остатков и прототипы классов. Объём матриц растёт с числом задач и квадратом размерности признака, а объём прототипов — линейно с числом классов.

Для внедрения статистику лучше собирать по мере обучения каждой задачи. Адаптированный вариант использует признаки кодировщика в состоянии после соответствующего этапа, поэтому одного финального набора весов может быть недостаточно для точного воспроизведения схемы. Это не повторное обучение, но такой сбор нужно включить в конвейер заранее.

Работа не заменяет методы борьбы с забыванием и не закрывает весь разрыв до режима с известной задачей. Она добавляет отдельный слой принятия решения там, где знания уже сохранились, но классификационные головы неверно конкурируют между собой.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу