Журнал · Rit.work

Dream-RSI превращает историю агента в тренажёр для поиска

Dream-RSI проверяет новые стратегии исследования на сохранённых попытках агента, сокращая число дорогих прогонов без замены базовой модели.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Историю работы агента научились использовать не как память-подсказку, а как среду для проверки новых стратегий поиска. В препринте, который не прошёл рецензирование и содержит замеры самих авторов, Tong Zheng и соавторы показали, что Dream-RSI в отдельных задачах требует до 162 раз меньше вызовов агента, чем SimpleTES. Это позволяет улучшать диспетчер поиска между дорогими прогонами, не меняя базовую модель.

История попыток становится симулятором поиска

Агент в длинном цикле предлагает решение, запускает его проверку, получает оценку и выбирает следующее направление. Обычно стратегия этого выбора остаётся фиксированной либо меняется прямо во время работы, когда результат каждого эксперимента приходится ждать и оплачивать.

Dream-RSI отделяет такую стратегию от самого агента. Небольшой программируемый слой решает, какую ветвь продолжить, сколько попыток запустить параллельно и когда остановиться. Агент, модель-оценщик и интерфейсы исполнения при этом остаются прежними.

Каждый реальный прогон сохраняется как дерево. В узле лежат рабочее состояние, созданный артефакт, результат исполнения, диагностические сообщения и оценка. Родитель узла показывает, с какой сохранённой версии агент начал следующую попытку.

После прогона это дерево превращается в симулятор повторного воспроизведения. Новая стратегия может иначе выбирать записанные ветви, менять их порядок, группировать попытки для параллельного запуска и раньше завершать поиск. Вызывать кодирующего агента и модель-оценщик заново не нужно: результаты уже лежат в узлах.

Отдельный агент редактирует исполняемый код стратегии и проверяет очередную версию на всех накопленных деревьях. Оценка учитывает лучшее найденное решение, условную стоимость представленных в маршруте попыток и пользу параллельной работы. Победившая версия возвращается в реальный прогон, создаёт новые ветви и тем самым расширяет материал для следующего цикла.

Такой симулятор не предсказывает неизвестный мир. Он позволяет переиграть только уже записанные переходы: стратегия может иначе пройти существующее дерево, но не увидеть результат шага, которого в истории не было. Новые данные по-прежнему появляются только во время реального запуска.

Экономия проявилась в разных типах задач

Dream-RSI проверили на 8 задачах из разработки алгоритмов, математической оптимизации и создания ядер GPU. Основным контролем служила Recursive Fixed Exploration: она начинала с той же стратегии и работала с теми же агентом, оценщиком, ресурсами и исходными условиями, но не улучшала правила исследования между циклами.

В задаче с алгоритмом для Lasso Dream-RSI использовал в 1,7 раза меньше вызовов агента, чем вариант с фиксированной стратегией. В математической оптимизации метод достигал сопоставимых или лучших результатов в пределах 1000 поколений поиска.

На задачах KernelBench выигрыш зависел от ядра. В одном случае агент достиг сопоставимой скорости за 2,43 раза меньше поколений, в другом при одинаковом бюджете получил производительность в 2,09 раза выше. Это не единая прибавка к качеству модели, а эффект от того, куда диспетчер направляет вычисления.

История оказалась полезнее как интерактивная среда, чем как текстовая рекомендация. Когда прошлые траектории сводили к прямым указаниям и добавляли в запрос, поиск работал хуже: подсказки слишком рано сужали набор направлений. Повторное воспроизведение сохраняло возможность сравнивать разные маршруты по фактическим результатам.

В планах меняется диспетчер, а не базовая модель

Работа предлагает архитектурное изменение для команд, которые строят агентов для оптимизации кода, алгоритмов или других задач с машинной проверкой результата. Стратегию исследования стоит вынести в отдельный программируемый компонент, а попытки сохранять как воспроизводимое дерево, а не только как журнал сообщений.

Для этого каждый узел должен содержать достаточно состояния, чтобы понять происхождение кандидата и результат его проверки. Важны также стабильная функция оценки и единый интерфейс выбора ветвей: реальный прогон и повторное воспроизведение должны показывать стратегии одинаковую структуру.

Подход рассчитан на длительный разветвлённый поиск, где одна и та же система многократно создаёт и автоматически проверяет кандидатов. В коротких сценариях без устойчивой оценки накопленное дерево даст мало материала, а отдельный цикл улучшения стратегии добавит лишнюю сложность.

Выбор лучшей стратегии по старым деревьям гарантирует только то, что она не уступает предыдущей на сохранённой истории. Реальный прогон может повести себя иначе, поскольку агент создаёт новые результаты случайно, а записанное дерево покрывает лишь часть пространства. Поэтому Dream-RSI меняет способ распределять бюджет, но не отменяет контрольные онлайн-запуски.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу