Журнал · Rit.work

PrimeScientist: бюджет становится частью политики исследовательского агента

PrimeScientist сохраняет альтернативные планы и по мере расходования токенов переходит от поиска новых направлений к доработке лучших, сокращая число полных экспериментальных циклов.

Rit.work
Студия разработки
17 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Автономного исследовательского агента научили распределять ограниченный бюджет между конкурирующими планами, а не продолжать только последнюю удачную ветку. Хотя работа не прошла рецензирование и числа получили сами авторы, PrimeScientist сократил число полных исследовательских попыток на 50,6% при более высокой средней оценке результата. Для команд это превращает выбор следующего эксперимента в отдельный слой архитектуры, который может снизить затраты на реализацию и проверку гипотез.

Как агент выбирает следующую исследовательскую ветку

Обычный исследовательский агент работает последовательно: предлагает изменение, правит код, запускает эксперимент и сохраняет результат, если целевая метрика улучшилась. Такая схема привязывает следующий шаг к текущей траектории. Перспективная альтернатива может исчезнуть из контекста, даже если к ней стоило вернуться после новых результатов.

PrimeScientist хранит работу как дерево исполнимых планов. В каждом узле лежат исследовательский вопрос, предлагаемое изменение, способ его реализовать и результаты предыдущих запусков. Дочерний узел описывает конкретную модификацию родительского плана, поэтому агент может восстановить ветку без истории диалога с исполнителем.

У агента есть два типа действий. Он либо запускает непроверенный план через исполнителя, который пишет и отлаживает код, проводит эксперимент и анализирует результат, либо расширяет уже проверенный узел новыми вариантами. Оба действия расходуют общий бюджет токенов: подготовка альтернатив конкурирует с их практической проверкой.

Для выбора ветки используется поиск Монте-Карло по дереву (MCTS). Результат эксперимента обновляет ценность не только выбранного плана, но и его предков. Непроверенные ветки получают предварительную оценку от отдельного агента, который анализирует накопленные наблюдения и предлагает следующие планы.

Оставшийся бюджет меняет саму политику выбора. В начале PrimeScientist распределяет попытки шире, поскольку новые данные ещё пригодятся для последующих решений. Ближе к исчерпанию бюджета он чаще выбирает ветки с высокой текущей оценкой: исследовать альтернативу уже менее выгодно, если времени использовать найденное почти не осталось.

Где дерево планов сократило число экспериментов

В сводке по задачам исследования ИИ средняя итоговая оценка PrimeScientist оказалась на 10,3% выше, чем у AutoResearch. Базовая система последовательно улучшает текущий вариант, тогда как PrimeScientist сохраняет конкурирующие объяснения и возвращается к ним по результатам экспериментов.

В повторных прогонах на шести задачах AutoLab средняя оценка двух систем практически совпала, но PrimeScientist использовал на 24% меньше попыток. Снижение сохранилось на каждой задаче этой части проверки, куда входили оптимизация операций с базами данных, численных вычислений и программ обработки данных.

На задаче о порядке обучения изображений дерево сохранило несколько объяснений наблюдаемого эффекта: ошибки в метках, особенности архитектуры и структуру изображений. PrimeScientist развивал ветки избирательно и достиг той же оценки за 12 попыток вместо 30. В дереве при этом остались как отброшенные варианты, так и подготовленные, но не запущенные эксперименты.

Проверка охватывала FIRE-Bench с исследовательскими вопросами об ИИ, AutoLab с системными задачами и оптимизацией кода, а также MLE-Bench с инженерными задачами машинного обучения. Основным соперником был AutoResearch, а бюджет токенов для планирования и исполнения выравнивали.

Бюджет не учитывал время работы CPU и GPU. Поэтому меньшее число полных попыток показывает экономию экспериментальных циклов, но не означает такое же процентное снижение облачного счёта: планирование дерева тоже расходует токены, а стоимость самого эксперимента зависит от задачи.

Когда эту схему стоит закладывать в архитектуру

Работа меняет планы команд, которые строят агента вокруг цикла «изменить код — запустить — измерить». Одной памяти о предыдущих шагах здесь недостаточно. Системе нужен постоянный реестр альтернативных планов, результатов и затрат, иначе политика не сможет сравнить возврат к старой ветке с продолжением текущей.

Второй необходимый компонент — единый учёт ресурсов. PrimeScientist списывает из одного бюджета токены агента, который составляет планы, и агента, который их исполняет. Это не позволяет бесконечно улучшать описание исследования, не оставляя ресурсов на проверку, или, наоборот, запускать серию слабо обоснованных изменений.

Политику выбора полезно отделить от исполнителя. В описанной системе исполнитель получает план, но не знает глобальный остаток бюджета. Решение о направлении и допустимой степени исследования принимает внешний слой. Благодаря этому кодовый агент можно заменить, не перестраивая дерево и правила распределения ресурсов.

Переписывать действующую систему целиком ради PrimeScientist рано. Практический первый шаг — сохранять несколько исполнимых вариантов, считать стоимость планирования вместе с исполнением и менять широту поиска по мере расходования бюджета. На процессах, где основную цену задают GPU, лабораторные установки или ручная проверка, потребуется другой учёт ресурсов: в работе политика оптимизирует единый бюджет токенов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу