Журнал · Rit.work

Реранкер учится на собственных ошибках вместо копирования учителя

SAP Labs предложила обучать компактный реранкер на созданных им самим ранжированиях: по замерам авторов, это улучшает перенос на новые задачи относительно офлайн-дистилляции.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи SAP Labs представили компактный реранкер для поиска по инструкциям; работа опубликована как препринт, не проходивший рецензирования. На задачах со сдвигом распределения модель авторов опередила офлайн-дистилляцию на 4,6 пункта nDCG@6. Результат важен для команд, которые сжимают поисковые модели для корпоративных баз знаний, ассистентов и других систем с ограничениями по задержке.

Что сделали

Реранкер получает запрос, инструкцию на естественном языке и набор найденных документов, после чего меняет их порядок. Авторы построили обучение в два этапа. Сначала модель-учителя на 4 млрд параметров дообучили методом групповой относительной оптимизации политики GRPO: модель-оценщик назначала награду вариантам ранжирования.

Затем знания перенесли в модель на 1 млрд параметров. В отличие от обычной дистилляции, ученик не копировал оценки учителя на заранее подготовленном наборе. Он сам создавал варианты порядка документов, а учитель оценивал каждый вариант мягкой наградой. Так обучение охватывает ошибки и решения, возникающие именно у ученика.

На MAIR-11, где задачи отличаются от обучающего распределения, этот подход дал заявленное преимущество над списочной офлайн-дистилляцией. nDCG@6 показывает качество порядка первых результатов с повышенным весом документов на верхних позициях. Контрольные эксперименты с попарной офлайн-дистилляцией RankNet и сопоставлением распределений учителя не воспроизвели тот же результат.

Что это значит

Для продукта вывод работы состоит не просто в выборе ещё одной функции потерь. Если компактная модель будет работать с новыми отраслями, типами документов или формулировками инструкций, полезнее обучать её на собственных ранжированиях, чем ограничиваться фиксированными ответами учителя. Это может стать аргументом в пользу более сложного этапа дистилляции, когда устойчивость к смене данных важнее простоты обучения.

Ограничения. Авторы проверяли метод только на англоязычном текстовом реранжировании: обучение включало 88 755 примеров, а наиболее широкий внешний тест MAIR — 126 задач. Работа не показывает перенос на другие языки, мультимодальные документы и реальные производственные потоки. Сравнение с выпущенными моделями также не полностью симметрично: внешние реранкеры запускались без адаптации на MAIR, тогда как модель авторов прошла собственный двухэтапный цикл обучения.

Источники

Иллюстрация: рисунок из статьи «On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers», Vignesh Prabhakar, Jialing Pan, Anil Babu Ankisettipalli, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу