Журнал · Rit.work

Средняя метрика не замечает поломку квантованного поиска

Разрыв между двумя лучшими оценками показывает, когда квантование меняет первый результат поиска и каким слоям модели стоит вернуть дополнительную точность.

Rit.work
Студия разработки
22 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Квантованная модель может почти не потерять в классификации, но заменить первый результат в поисковой выдаче. В работе, которая пока не рецензирована и чьи числа получили сами авторы, такие замены затронули 14–46% запросов. Для поисковых систем проверять только среднюю метрику качества после квантования недостаточно.

Первый результат меняется чаще, чем показывает средняя метрика

Квантование округляет веса модели до меньшей разрядности, чтобы сократить память и ускорить вычисления. Обычно его оценивают по итоговой точности: если она почти не упала, модель считают пригодной к эксплуатации.

Для поиска (retrieval) такой проверки мало. Система не выбирает один класс, а сортирует множество документов, изображений или товаров. Небольшого изменения оценок достаточно, чтобы соседние кандидаты поменялись местами.

При четырёхбитном округлении одни и те же семейства моделей меняли ответ классификации для 3–6% входов, а первый результат поиска — для 33–46% запросов. Задача изменилась, хотя модель и способ квантования остались прежними.

Средняя метрика скрывает часть перестановок. В CLIP показатель полноты первого результата снизился лишь на 1,3%, но примерно один из десяти запросов, прежде находивших правильное изображение, после квантования его потерял. Улучшения на других запросах частично компенсируют этот ущерб в среднем значении, хотя конкретным пользователям система уже возвращает другие объекты.

Для RAG последствия возникают на поисковом этапе: другой документ попадает в контекст и может изменить ответ генератора. Саму генерацию работа не измеряет.

Разрыв между двумя лидерами показывает риск перестановки

Причина различий — расстояние между первой и второй оценками. При классификации функция потерь подталкивает модель отделять правильный класс от остальных. При обучении поиска положительный документ отделяют от выбранных отрицательных примеров, но модель не обязана создавать большой запас между двумя лучшими кандидатами во всей базе.

Авторы описывают условие устойчивости через максимальную ошибку ε, с которой квантование сдвигает любую оценку. Если разрыв между лидером и ближайшим кандидатом не меньше удвоенной ошибки, первый результат гарантированно сохранится: даже самое невыгодное округление не позволит сопернику выйти вперёд.

Во время эксплуатации полная версия модели обычно недоступна, поэтому точную ошибку для каждого запроса измерить нельзя. Вместо неё заранее калибруют порог на неразмеченных данных, прогоняя их через полную и квантованную модели. Затем система сравнивает с порогом разрыв между двумя лучшими оценками уже квантованной модели и решает, можно ли доверять её первому результату.

Основная проверка охватила 53 дообученных контрольных точки ViT и Qwen3-Embedding для изображений и текста. Модели использовали в классификации и поиске; дополнительные опыты включали CLIP, несколько текстовых моделей и перекрёстный переранжировщик. Эффект сохранился у простого округления и у GPTQ, AWQ, HQQ и AdaRound, поэтому он не сводится к одному слабому способу квантования.

Поиску и классификации нужны разные схемы эксплуатации

Для классификации подходит маршрутизация. Квантованная модель сначала считает ответ и разрыв между двумя классами, а запросы с малым разрывом отправляет в полную модель. Большинство входов проходит проверку, поэтому дорогой повторный расчёт нужен лишь для группы риска.

В поиске такая схема помогает хуже: близкие оценки встречаются у слишком многих запросов. Здесь авторы предлагают смешанную разрядность — давать больше битов слоям, квантование которых сильнее всего сдвигает разрыв между двумя лидерами. При средней разрядности 3,5 бита этот критерий вернул 60–75% улучшения от полного перехода с трёх на четыре бита, использовав половину дополнительной разрядности.

Для команды практический вывод начинается с приёмочных тестов. После квантования поисковой модели стоит измерять не только nDCG или полноту, но и долю запросов, где первый результат расходится с полной версией. Разрез по величине разрыва покажет, сосредоточена ли проблема в небольшой группе запросов или охватывает почти всю нагрузку.

Если нестабильных запросов мало, можно оставить квантованную модель основным маршрутом и выборочно обращаться к полной. Если нестабильна большая часть выдачи, планы следует менять до развёртывания: распределять разрядность по чувствительности слоёв либо сохранять больше точности во всём поисковом контуре. Одинаковая схема оптимизации для классификатора и поискового энкодера здесь даёт разные риски.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу