Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
AdaTutoRank научили выбирать для ответа не самые релевантные документы по отдельности, а полезный набор без повторов и пробелов. Работа University of Science and Technology of China, Yuanbao Team и Tencent показывает преимущество в 2,17 пункта над ближайшим базовым методом, хотя препринт не рецензирован, а числа получили сами авторы. Для RAG это переносит точку оптимизации с порядка ссылок на состав контекста.
Релевантность документа не гарантирует качество набора
Обычная модель повторного ранжирования оценивает каждый документ относительно запроса, сортирует результаты и отдаёт генератору верхнюю часть списка. Такой подход не учитывает, как документы сочетаются друг с другом.
Несколько результатов могут пересказывать один факт, противоречить друг другу или освещать только одну сторону вопроса. Каждый из них формально релевантен, но вместе они расходуют контекст и не дают материала для полного ответа.
AdaTutoRank сразу предсказывает идентификаторы документов, которые должны войти в итоговый набор. Его размер зависит от запроса, а не от заранее заданной границы. Модель решает одновременно, какие источники дополняют друг друга и когда найденных доказательств уже достаточно.
Качество набора описывают 9 критериев на 3 уровнях. Для отдельного документа проверяют релевантность, достоверность и качество. Для сочетания документов — взаимное дополнение, повторы и конфликты. Набор целиком оценивают по полноте, плотности полезной информации и тому, насколько легко модель найдёт в контексте нужные факты.
Подсказка зависит от того, насколько ошибся кандидат
Обучение начинается с автоматически подготовленных эталонов. DeepSeek-V4 Pro получает запрос, кандидатов и критерии, после чего составляет подходящий набор. На этих примерах AdaTutoRank осваивает требуемый формат и учится выбирать документы без критериев, которые нельзя получить при реальном запросе без готового ответа.
Затем модель обучают на собственных вариантах наборов. DeepSeek-V4-Flash выставляет общую оценку, но одного числа недостаточно: хороший документ внутри слабого набора получит тот же штраф, что и лишний, а повторяющий чужую информацию источник разделит награду с полезными.
Чтобы разделить вклад документов, замороженная копия текущей модели формирует подсказку одного из 3 типов. Хорошему варианту показывают только критерии. Частично верному дают разбор того, какие документы стоит убрать или добавить. Слабому предъявляют другой набор, выбранный той же моделью с учётом критериев.
После этого замороженная копия повторно оценивает уже созданную последовательность идентификаторов — сначала без подсказки, затем с ней. Разница показывает, для каких токенов подсказка повысила или понизила уверенность. Этот сигнал объединяют с общей наградой за набор: модель одновременно учится улучшать конечный результат и различать вклад каждого выбранного документа.
Подсказки нужны только во время обучения. При использовании AdaTutoRank получает запрос, общие правила отбора и найденные документы, поэтому отдельный учитель и заранее подготовленные критерии для каждого запроса не требуются.
Работа меняет план эксперимента, но не готовую архитектуру
Метод проверяли на 10 бенчмарках, которые охватывают RAG, многошаговый поиск и непосредственную оценку наборов. В экспериментах использовали AdaTutoRank размером 8B и сравнивали его с моделями обычного ранжирования, рассуждающего ранжирования и выбора наборов. Кандидатов получали существующим поиском, а качество измеряли как по итоговым ответам, так и по составу контекста.
Проверка с отключением компонентов подтверждает, что преимущество даёт не только начальное обучение на эталонах. Полная схема получила сводную оценку 49,19, а обучение лишь по общей награде за набор — 45,07. Фиксированная подсказка каждого типа также уступила адаптивному выбору: слишком подробный пример мешал сильным вариантам, а одних критериев не хватало слабым.
Для команды с обычным ранжированием работа добавляет конкретный вариант пилота: заменить фиксированный верх списка на модель, которая возвращает набор переменного размера. Особенно прямое применение — сложные вопросы, где ответ требует нескольких дополняющих источников, а повторы занимают заметную часть контекста.
Перестраивать весь RAG вокруг результата пока рано. Эксперименты проведены с конкретной моделью, автоматически созданными эталонами и оценщиком DeepSeek; выигрыш показан внутри этой схемы обучения. Практический следующий шаг — сравнить наборный и обычный ранжировщики на собственных поисковых результатах, измеряя качество ответа, объём переданного контекста и число дополнительных поисковых шагов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



