Журнал · Rit.work

Dr.Credit распределяет награду между шагами исследовательского агента

Dr.Credit оценивает, какие поисковые шаги добавили сведения по рубрике, и обучает исследовательского агента без готового правильного ответа.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследовательских агентов научили отличать полезный поиск от шага, который лишь повторяет уже найденное, даже когда эталонного ответа нет. Dr.Credit обошёл обучение только по итоговой награде на всех проверенных наборах; поскольку препринт не рецензировали, все числа в нём получили сами авторы. Метод позволяет давать агенту отдельный обучающий сигнал после каждого обращения к поиску или веб-странице, а не оценивать только готовый отчёт.

Как рубрика показывает вклад отдельного шага

При обучении с подкреплением исследовательский агент обычно получает награду за итоговый ответ. Групповая относительная оптимизация политики (GRPO) сравнивает несколько траекторий для одного задания, но внутри каждой траектории назначает промежуточным действиям общую оценку.

Из-за этого хороший отчёт может закрепить бесполезный запрос, если агент позднее нашёл нужные сведения другим способом. Возможна и обратная ошибка: полезное чтение страницы получит отрицательный сигнал, если агент плохо собрал финальный текст.

Dr.Credit использует требования к отчёту как общую точку отсчёта. Для каждого пункта рубрики система хранит историю уже принятой поддержки: факты, связи, оговорки и другие сведения, которые помогают выполнить требование.

После чтения страницы модель-оценщик сравнивает её содержимое не с готовым ответом, а с этой историей. Новые сведения приносят шагу вклад, частичная поддержка учитывается отдельно, а повтор уже известного не получает награды. Затем принятые сведения добавляются в историю и становятся основой для оценки следующих страниц.

Поисковый запрос получает вклад двумя путями. Если агент позднее открыл найденную ссылку, запросу передают оценку соответствующего чтения. Если ссылка осталась неоткрытой, отдельная модель-оценщик проверяет краткий фрагмент из поисковой выдачи, но не меняет историю прочитанных доказательств.

Вклад промежуточных шагов нормализуют среди траекторий для одного задания и складывают с итоговой наградой GRPO. Финальный ответ по-прежнему оценивают целиком, поэтому метод не заменяет контроль качества отчёта, а добавляет сигнал о том, какие действия к нему привели.

Агент ищет меньше, но набирает больше

Обучение проводили на DeepRubric, а проверку — на DeepRubric, ResearchQA, DeepResearchBench и ResearchRubrics. Основой служила Qwen3-8B; агент располагал только инструментами Search для выдачи и Visit для чтения страниц. В сравнение вошли агенты на той же основе, открытые исследовательские модели, обычный поиск с генерацией и закрытые модели с теми же инструментами.

Средний результат Dr.Credit составил 61,7 балла против 58,2 у GRPO без оценки промежуточных шагов. Агент обошёл все открытые базовые системы по основным показателям и их составляющим, а среди закрытых моделей оказался ниже лучшей, но выше нескольких других участников сравнения.

Дополнительная оценка каждого шага сначала увеличивала расходы на обучение. Затем агент стал реже обращаться к инструментам и быстрее собирать достаточные доказательства: к концу замера общее время обучения с учётом оценки сократилось на 14,9% относительно GRPO. Этот результат зависит от измеренной авторами асинхронной системы, где оценка шагов выполнялась параллельно со сбором новых траекторий.

История по рубрикам меняла и сам обучающий сигнал. Страница, которая выглядела полезной без контекста, могла получить нулевой вклад, если её сведения уже встречались раньше. Метод тем самым учит не просто находить релевантные источники, а прекращать повторный сбор одинаковых доказательств.

Когда Dr.Credit меняет план разработки

Работа касается этапа обучения, а не готового исследовательского запроса. Подключить Dr.Credit как ещё один инструмент во время выполнения задачи нельзя: команде нужны размеченные требования, несколько траекторий для каждого задания, модель-оценщик и контур обучения с подкреплением.

Метод имеет практический смысл, если продукт уже проверяет открытые ответы по отдельным критериям. Та же рубрика может оценивать итоговый отчёт и направлять поиск, поэтому не приходится создавать канонический ответ для каждого запроса. Это особенно полезно там, где допустимы разные выводы и наборы источников, но заранее известно, какие аспекты должен покрыть результат.

Архитектуру агента тоже придётся учитывать. В эксперименте вклад привязан к двум понятным действиям: получить поисковую выдачу и прочитать страницу. Для агента с кодом, базами данных, внутренними документами и многошаговыми рабочими процессами команде потребуется определить, что считать новой поддержкой рубрики и как переносить вклад между связанными действиями.

Dr.Credit не доказывает, что пошаговая оценка окупится в любой агентской системе. Но работа даёт воспроизводимую схему для продуктов, где итоговая награда слишком поздно объясняет ошибку: хранить найденные основания отдельно по каждому требованию, оценивать только добавленные сведения и совмещать этот сигнал с качеством конечного ответа.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу