Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Промежуточные выводы исследовательского агента научились блокировать до того, как они направят поиск по неверному пути, а уже принятые решения — локально отменять. Препринт с участием University of British Columbia не рецензирован, а все числа в нём получили сами авторы: DeepRewind повысил полноту найденных тезисов на 3,6 процентного пункта и сократил долю преждевременных выводов на 59,1% относительно Open Deep Research. Для команд, которые строят длинные исследования по многим источникам, работа предлагает отдельный контрольный слой вместо полной замены агента.
Как DeepRewind оценивает риск промежуточного вывода
Проблема возникает не только в финальном ответе. Агент может рано выбрать одну гипотезу, отбросить альтернативу или начать писать раздел отчёта, после чего следующие запросы и оценки источников будут укреплять исходное решение.
DeepRewind хранит текущее знание агента как направленный граф. Его узлы обозначают источники, свидетельства, утверждения, гипотезы, допущения, принятые решения, шаги плана и фрагменты черновика. Связи показывают, что поддерживает или опровергает утверждение, от чего зависит план и какой вывод закрепил выбранную гипотезу.
Перед фиксацией промежуточного вывода отдельная LLM прогнозирует, как он изменит граф. Она оценивает четыре свойства: насколько сузится набор гипотез, какая противоречащая информация потеряет влияние, сколько последующих элементов придётся исправлять и сможет ли будущий поиск обнаружить опровержение.
Из этих оценок контроллер рассчитывает риск необратимости. Он пропускает решение, если ожидаемая польза оправдывает риск, либо оставляет его неподтверждённым. Во втором случае основной агент продолжает искать свидетельства, сохраняет конкурирующие гипотезы или формулирует более осторожное утверждение.
Такой контроль отличается от самопроверки готового ответа. DeepRewind вмешивается в момент, когда промежуточное решение ещё не успело изменить поисковые запросы, план и текст отчёта. При этом он не меняет инструменты поиска и генерации базового агента.
Почему откат затрагивает только зависимую часть исследования
Для каждого принятого решения система сохраняет условие отмены: какое надёжное и достаточно сильное противоречие должно появиться. Новые свидетельства постоянно сверяются с этими условиями. Если поддержка утверждения падает ниже порога, монитор отменяет решение без дополнительного вызова LLM.
Откат идёт по зависимостям в графе. Система помечает устаревшими только гипотезы, шаги плана и фрагменты черновика, которые опирались на опровергнутый вывод. Результаты с независимыми источниками остаются в работе, поэтому агенту не нужно начинать исследование заново.
История при этом не удаляется. Изменения попадают в журнал, куда записи только добавляются, а отменённые элементы получают отметки «оспорено», «устарело» или «отозвано». Такой след позволяет восстановить, почему агент выбрал направление и какое новое свидетельство заставило его вернуться назад.
Слабое место схемы находится в самом графе. Если LLM пропустит зависимость или неверно оценит последствия решения, контроллер может заблокировать полезный вывод либо оставить рискованный. Точность прогнозов перехода между состояниями отдельно не проверяли: бенчмарки оценивают итоговый отчёт, а не правильность внутреннего графа.
Когда команде стоит добавить обратимый контур
На двух бенчмарках DeepRewind повысил точность тезисов — долю результатов, совпавших с эталонными, — на 3,1 процентного пункта. Улучшение полноты не привело к росту числа неподтверждённых тезисов, но потребовало дополнительных ресурсов: время выполнения выросло на 14%, объём входных токенов — на 6,5%, выходных — на 4,2%.
Метод проверяли на DRBench и LiveDRBench, в каждом из которых было по 100 заданий, с GPT-4o, GPT-5.4, Qwen3.5-27B и DeepSeek-V4 Pro в роли базовых моделей. GPT-4o во всех основных опытах оценивал состояние исследования, а агент выполнял до 10 итераций поиска. Сравнение шло с Open Deep Research при неизменных поиске и генерации отчёта.
Эти границы делают результат применимым прежде всего к агентам, которые долго исследуют открытый вопрос, собирают несколько источников и выпускают отчёт со ссылками. Для короткого диалога или однократного поиска граф зависимостей и отдельная модель оценки добавят архитектурную сложность, хотя работа не показывает сопоставимой пользы для таких сценариев.
Менять базовую модель или весь процесс ради DeepRewind не требуется. Практический план — вынести промежуточные утверждения, гипотезы и фрагменты отчёта в явное состояние, записывать их зависимости, а затем поставить две точки контроля: перед фиксацией вывода и после появления противоречащего свидетельства.
Сначала такой слой разумно включать для решений с дорогими последствиями: выбора основной гипотезы, исключения альтернативы и переноса утверждения в итоговый текст. Полный граф каждого поискового шага увеличит расходы и усложнит диагностику, тогда как контроль нескольких типов решений позволит проверить, окупают ли локальные откаты задержку.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



