Журнал · Rit.work

LLM учит компактную модель находить товар классом выше

Двухуровневая схема переносит объяснения LLM в компактный классификатор, а затем адаптирует его к критериям отдельных типов товаров без вызовов LLM при расчёте каталога.

Rit.work
Студия разработки
7 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систему рекомендаций научили находить товар классом выше без обращения к LLM для каждой пары. В препринте Siliang Liu и коллег, который не прошёл рецензирование и содержит замеры самих авторов, компактная модель оказалась примерно в 5000 раз быстрее и в 10 000 раз дешевле прямых вызовов LLM. Схема позволяет оставить генеративную модель в контуре обучения, а каталог рассчитывать обычным классификатором.

Как объяснение учителя превращается в оценку пары

Работа посвящена рекомендациям trade-up: кандидат должен сохранить покупательское намерение, но дать дополнительное преимущество за счёт состава, материалов, сертификации или позиции бренда. Связь направленная: более дорогая упаковка или другой объём сами по себе не делают кандидат улучшенной заменой.

LLM работает как учитель вне производственного контура. Она получает описания пары товаров, критерии для их типа и подобранные экспертные примеры, а затем выдаёт класс связи и краткое текстовое объяснение.

Компактный ученик обучается не только повторять метку учителя, но и приближать внутреннее представление пары к представлению текстового объяснения. Дополнительная проекция нужна лишь при обучении: при расчёте каталога её удаляют вместе с кодировщиком объяснений.

Авторы не сводят исходную задачу к ответу «подходит» или «не подходит». Модель различает товары одного уровня, улучшение в прямом и обратном направлении и несовместимую пару. Это оказалось существенным: объяснения учителя помогли при подробной классификации, но почти ничего не дали, когда все отрицательные случаи объединили в один класс.

На входе производственной модели остаются только заранее рассчитанные векторные представления двух товаров. Она не читает исходные описания, не генерирует текст и не вызывает API учителя, поэтому одну и ту же пару можно оценивать как обычный элемент пакетного расчёта.

Локальная адаптация дала основной прирост

Качество измеряли через площадь под ROC-кривой (AUC). Метрика показывает, насколько часто модель ставит подходящую улучшенную замену выше неподходящей; чем ближе результат к единице, тем лучше ранжирование при разных порогах.

При одинаковой неглубокой архитектуре обучение только на подробных метках дало AUC 0,912, а перенос текстовых объяснений поднял результат до 0,924. Значит, объяснение полезно не как текст для пользователя, а как дополнительный сигнал, который формирует пространство признаков ученика.

Затем авторы замораживают общую модель и перед расчётом каталога подстраивают небольшие адаптеры LoRA отдельно для каждого типа товара. Они называют этот этап PT-TTT: примеры с экспертными метками превращаются из контекста для LLM в обучающие данные для локального изменения границы решений. Итоговый AUC вырос до 0,941.

Общий адаптер, обученный на тех же экспертных примерах без разделения по типам, уступил локальным версиям. Проверка внутри отдельных товарных категорий также показала прирост, поэтому результат нельзя объяснить только разным масштабом оценок между категориями.

Повторное использование текстовых объяснений на этапе локальной настройки почти не повлияло на итог. Получилось разделение ролей: объяснения улучшают общую модель, а экспертные метки для конкретного типа товара дают основной эффект при адаптации.

Когда схема меняет архитектурный план

Подход применим там, где система заранее оценивает большое число пар, а правила связи зависят от сегмента. Вместо вызова LLM для каждой пары можно один раз получить от неё подробную обучающую разметку, подготовить общий классификатор и рассчитывать каталог по сохранённым векторам товаров.

Локальная настройка добавляет отдельный этап в конвейер. Для каждого типа товара нужно хранить экспертный набор, обучать адаптер и применять его ко всем парам этой категории. Затраты растут вместе с числом типов, а не с числом запросов, поэтому схема лучше подходит для пакетного пересчёта, чем для адаптации под каждую пользовательскую сессию.

Сравнение скорости провели примерно на 100 тысячах пар на одной машине с восемью GPU. Снижение стоимости расчётное, поэтому его нельзя переносить на другую LLM, оборудование или тариф API без собственного замера. Архитектурное преимущество при этом сохраняется: производственный контур выполняет классификацию вместо генерации.

Модель обучали на разметке учителя, а проверяли на экспертном наборе из 8352 пар по 29 типам товаров. Тестовые пары не пересекались с обучающими, но разделение не исключало повторения отдельных товаров и брендов; локальную адаптацию также оценивали на уже известных категориях.

Работа описывает классификатор товарных связей перед ранжированием, а не полноценную персональную рекомендательную систему. Для команды это скорее шаблон разделения дорогого семантического анализа и массового расчёта: LLM создаёт обучающий сигнал, компактная модель обслуживает каталог, а локальные адаптеры учитывают правила категории.

Источники

Иллюстрация: рисунок из статьи «Distill Globally, Adapt Locally: Reasoning Distillation and Product-Type Test-Time Training for Scalable Trade-Up Recommendation», Siliang Liu, Mohammad Ghasemi, Sapan Patel и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу