Журнал · Rit.work

Как разбить проверку товарных карточек и перенести её в меньшую LLM

Amazon Catalog AI разделила поиск дефектов в товарных семействах на короткие проверки и перенесла их в одну компактную модель с помощью Positional Task Conditioning.

Rit.work
Студия разработки
10 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Проверку длинных товарных семейств научились делить на короткие задачи, а затем объединять их в одной компактной LLM. В работе Amazon Catalog AI показатель F1 вырос с 52,14% до 87,62%, хотя препринт не рецензирован, а числа в нём получили сами авторы. Для каталожных систем это предлагает альтернативу одному сложному запросу к дорогой модели: несколько узких проверок и перенос знаний в локальную модель.

Длинную проверку заменили короткими классификаторами

Товарное семейство объединяет варианты одного продукта, например футболки разных размеров и цветов. Внутри возникают дубликаты вроде XL и Extra Large, смешиваются единицы измерения, в поле цвета попадают посторонние характеристики, а значения одного атрибута оказываются в другом.

Один запрос должен одновременно прочитать все варианты, применить правила для разных дефектов и вернуть несколько меток. Чем длиннее семейство, тем больше нерелевантного контекста приходится удерживать модели. В эксперименте Claude Sonnet 4.5 часто находила дефекты там, где их не было: основной выигрыш после разбиения пришёлся на долю верных срабатываний.

Авторы выделили четыре независимые задачи: переполнение атрибута, несовместимые единицы, дубликаты и нарушение темы атрибута. Каждую пару «задача — изменяющийся атрибут» модель относит к одному из трёх классов: серьёзная ошибка, несерьёзная ошибка или корректное значение. Затем система собирает ответы обратно на уровне семейства.

Так модель получает только правила выбранной проверки и значения нужного атрибута. Вызовов становится больше, зато каждый из них короче и не требует одновременно различать семантически несвязанные ошибки. F1 здесь показывает баланс между долей верных срабатываний и долей дефектов, которые система смогла найти.

Метка задачи удерживает модель на нужной проверке

Разделение хорошо сработало с Claude Sonnet 4.5, но вызывать её для каждого атрибута дорого. Поэтому ответы и цепочки рассуждений большой модели использовали как учебные примеры для Qwen3 и Mistral. Отдельную модель для каждой проверки обучать не стали: один экземпляр должен был выполнять их все.

Обычный перенос цепочек рассуждений заставляет компактную модель угадывать задачу по тексту инструкции. Запросы при этом устроены одинаково, поэтому модель может увидеть нужный признак, но применить правила другой проверки.

Positional Task Conditioning добавляет явный идентификатор задачи в структурные границы запроса: перед вводной частью, перед товарными данными и перед генерацией ответа. Архитектуру модели менять не нужно, однако эти же идентификаторы должны присутствовать и при обучении, и при использовании.

На моделях семейств Qwen3 и Mistral такой подход стабильно обошёл перенос рассуждений без идентификаторов. Лучшая компактная модель отстала от Claude Sonnet 4.5 по F1 лишь на 1,79 процентного пункта, а разница была статистически значима для большинства проверенных моделей.

Один пример показывает, откуда берётся выигрыш. В списке цветов были Dark Gray и Dark Grey. Модель без явной метки задачи заметила пару, но решила, что это допустимые варианты написания; PTC сохранила фокус на поиске дубликатов и отметила ошибку.

Сначала стоит менять схему проверки, а не базовую модель

Работа меняет планы команд, у которых одна LLM одновременно ищет несколько типов ошибок в длинной записи. Перед заменой модели имеет смысл разделить такую проверку по сущностям и правилам, измерить качество каждого классификатора и только затем решать, нужен ли перенос знаний.

PTC особенно уместен, если подзадачи похожи по форме, но требуют разных критериев. Идентификатор задачи тогда становится частью протокола наряду со схемой ответа: его нельзя удалить при переработке запроса, не проверив качество заново.

Экономика проявляется на повторяющейся нагрузке. Обработка тестового набора через Claude Sonnet 4.5 стоила около 63 долларов, а через Mistral Nemo на арендованных H100 — около 1,17 доллара. Это сравнение зависит от указанной аппаратной конфигурации и публичных цен, но показывает, за счёт чего окупается обучение компактной модели.

Система уже обрабатывает свыше 10 миллионов товарных семейств в нескольких странах. Однако эксперимент ограничен каталогами: основная проверка включала 2296 размеченных людьми пар «семейство — атрибут», дополнительная — 11 130 синтетических пар. Данные проприетарные, а перенос на другие виды документов и на большее число задач в работе не проверяли.

Практический вывод состоит не в том, что PTC заменяет дорогую LLM в любой классификации. Работа даёт воспроизводимую схему для конкретного класса систем: сократить контекст, изолировать решения, обучить одну меньшую модель на ответах большой и явно закрепить выбранную задачу в нескольких границах запроса.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу