Журнал · Rit.work

AdaTutoRank учит RAG выбирать набор доказательств вместо списка ссылок

AdaTutoRank оценивает документы как единый набор и подбирает обучающую подсказку по качеству ответа, чтобы RAG получал полные и непротиворечивые доказательства.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

AdaTutoRank научили выбирать для ответа не самые релевантные документы по отдельности, а полезный набор без повторов и пробелов. Работа University of Science and Technology of China, Yuanbao Team и Tencent показывает преимущество в 2,17 пункта над ближайшим базовым методом, хотя препринт не рецензирован, а числа получили сами авторы. Для RAG это переносит точку оптимизации с порядка ссылок на состав контекста.

Релевантность документа не гарантирует качество набора

Обычная модель повторного ранжирования оценивает каждый документ относительно запроса, сортирует результаты и отдаёт генератору верхнюю часть списка. Такой подход не учитывает, как документы сочетаются друг с другом.

Несколько результатов могут пересказывать один факт, противоречить друг другу или освещать только одну сторону вопроса. Каждый из них формально релевантен, но вместе они расходуют контекст и не дают материала для полного ответа.

AdaTutoRank сразу предсказывает идентификаторы документов, которые должны войти в итоговый набор. Его размер зависит от запроса, а не от заранее заданной границы. Модель решает одновременно, какие источники дополняют друг друга и когда найденных доказательств уже достаточно.

Качество набора описывают 9 критериев на 3 уровнях. Для отдельного документа проверяют релевантность, достоверность и качество. Для сочетания документов — взаимное дополнение, повторы и конфликты. Набор целиком оценивают по полноте, плотности полезной информации и тому, насколько легко модель найдёт в контексте нужные факты.

Подсказка зависит от того, насколько ошибся кандидат

Обучение начинается с автоматически подготовленных эталонов. DeepSeek-V4 Pro получает запрос, кандидатов и критерии, после чего составляет подходящий набор. На этих примерах AdaTutoRank осваивает требуемый формат и учится выбирать документы без критериев, которые нельзя получить при реальном запросе без готового ответа.

Затем модель обучают на собственных вариантах наборов. DeepSeek-V4-Flash выставляет общую оценку, но одного числа недостаточно: хороший документ внутри слабого набора получит тот же штраф, что и лишний, а повторяющий чужую информацию источник разделит награду с полезными.

Чтобы разделить вклад документов, замороженная копия текущей модели формирует подсказку одного из 3 типов. Хорошему варианту показывают только критерии. Частично верному дают разбор того, какие документы стоит убрать или добавить. Слабому предъявляют другой набор, выбранный той же моделью с учётом критериев.

После этого замороженная копия повторно оценивает уже созданную последовательность идентификаторов — сначала без подсказки, затем с ней. Разница показывает, для каких токенов подсказка повысила или понизила уверенность. Этот сигнал объединяют с общей наградой за набор: модель одновременно учится улучшать конечный результат и различать вклад каждого выбранного документа.

Подсказки нужны только во время обучения. При использовании AdaTutoRank получает запрос, общие правила отбора и найденные документы, поэтому отдельный учитель и заранее подготовленные критерии для каждого запроса не требуются.

Работа меняет план эксперимента, но не готовую архитектуру

Метод проверяли на 10 бенчмарках, которые охватывают RAG, многошаговый поиск и непосредственную оценку наборов. В экспериментах использовали AdaTutoRank размером 8B и сравнивали его с моделями обычного ранжирования, рассуждающего ранжирования и выбора наборов. Кандидатов получали существующим поиском, а качество измеряли как по итоговым ответам, так и по составу контекста.

Проверка с отключением компонентов подтверждает, что преимущество даёт не только начальное обучение на эталонах. Полная схема получила сводную оценку 49,19, а обучение лишь по общей награде за набор — 45,07. Фиксированная подсказка каждого типа также уступила адаптивному выбору: слишком подробный пример мешал сильным вариантам, а одних критериев не хватало слабым.

Для команды с обычным ранжированием работа добавляет конкретный вариант пилота: заменить фиксированный верх списка на модель, которая возвращает набор переменного размера. Особенно прямое применение — сложные вопросы, где ответ требует нескольких дополняющих источников, а повторы занимают заметную часть контекста.

Перестраивать весь RAG вокруг результата пока рано. Эксперименты проведены с конкретной моделью, автоматически созданными эталонами и оценщиком DeepSeek; выигрыш показан внутри этой схемы обучения. Практический следующий шаг — сравнить наборный и обычный ранжировщики на собственных поисковых результатах, измеряя качество ответа, объём переданного контекста и число дополнительных поисковых шагов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу