Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи SAP Labs представили компактный реранкер для поиска по инструкциям; работа опубликована как препринт, не проходивший рецензирования. На задачах со сдвигом распределения модель авторов опередила офлайн-дистилляцию на 4,6 пункта nDCG@6. Результат важен для команд, которые сжимают поисковые модели для корпоративных баз знаний, ассистентов и других систем с ограничениями по задержке.
Что сделали
Реранкер получает запрос, инструкцию на естественном языке и набор найденных документов, после чего меняет их порядок. Авторы построили обучение в два этапа. Сначала модель-учителя на 4 млрд параметров дообучили методом групповой относительной оптимизации политики GRPO: модель-оценщик назначала награду вариантам ранжирования.
Затем знания перенесли в модель на 1 млрд параметров. В отличие от обычной дистилляции, ученик не копировал оценки учителя на заранее подготовленном наборе. Он сам создавал варианты порядка документов, а учитель оценивал каждый вариант мягкой наградой. Так обучение охватывает ошибки и решения, возникающие именно у ученика.
На MAIR-11, где задачи отличаются от обучающего распределения, этот подход дал заявленное преимущество над списочной офлайн-дистилляцией. nDCG@6 показывает качество порядка первых результатов с повышенным весом документов на верхних позициях. Контрольные эксперименты с попарной офлайн-дистилляцией RankNet и сопоставлением распределений учителя не воспроизвели тот же результат.
Что это значит
Для продукта вывод работы состоит не просто в выборе ещё одной функции потерь. Если компактная модель будет работать с новыми отраслями, типами документов или формулировками инструкций, полезнее обучать её на собственных ранжированиях, чем ограничиваться фиксированными ответами учителя. Это может стать аргументом в пользу более сложного этапа дистилляции, когда устойчивость к смене данных важнее простоты обучения.
Ограничения. Авторы проверяли метод только на англоязычном текстовом реранжировании: обучение включало 88 755 примеров, а наиболее широкий внешний тест MAIR — 126 задач. Работа не показывает перенос на другие языки, мультимодальные документы и реальные производственные потоки. Сравнение с выпущенными моделями также не полностью симметрично: внешние реранкеры запускались без адаптации на MAIR, тогда как модель авторов прошла собственный двухэтапный цикл обучения.
Источники
Иллюстрация: рисунок из статьи «On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers», Vignesh Prabhakar, Jialing Pan, Anil Babu Ankisettipalli, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



