Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Автономного исследовательского агента научили распределять ограниченный бюджет между конкурирующими планами, а не продолжать только последнюю удачную ветку. Хотя работа не прошла рецензирование и числа получили сами авторы, PrimeScientist сократил число полных исследовательских попыток на 50,6% при более высокой средней оценке результата. Для команд это превращает выбор следующего эксперимента в отдельный слой архитектуры, который может снизить затраты на реализацию и проверку гипотез.
Как агент выбирает следующую исследовательскую ветку
Обычный исследовательский агент работает последовательно: предлагает изменение, правит код, запускает эксперимент и сохраняет результат, если целевая метрика улучшилась. Такая схема привязывает следующий шаг к текущей траектории. Перспективная альтернатива может исчезнуть из контекста, даже если к ней стоило вернуться после новых результатов.
PrimeScientist хранит работу как дерево исполнимых планов. В каждом узле лежат исследовательский вопрос, предлагаемое изменение, способ его реализовать и результаты предыдущих запусков. Дочерний узел описывает конкретную модификацию родительского плана, поэтому агент может восстановить ветку без истории диалога с исполнителем.
У агента есть два типа действий. Он либо запускает непроверенный план через исполнителя, который пишет и отлаживает код, проводит эксперимент и анализирует результат, либо расширяет уже проверенный узел новыми вариантами. Оба действия расходуют общий бюджет токенов: подготовка альтернатив конкурирует с их практической проверкой.
Для выбора ветки используется поиск Монте-Карло по дереву (MCTS). Результат эксперимента обновляет ценность не только выбранного плана, но и его предков. Непроверенные ветки получают предварительную оценку от отдельного агента, который анализирует накопленные наблюдения и предлагает следующие планы.
Оставшийся бюджет меняет саму политику выбора. В начале PrimeScientist распределяет попытки шире, поскольку новые данные ещё пригодятся для последующих решений. Ближе к исчерпанию бюджета он чаще выбирает ветки с высокой текущей оценкой: исследовать альтернативу уже менее выгодно, если времени использовать найденное почти не осталось.
Где дерево планов сократило число экспериментов
В сводке по задачам исследования ИИ средняя итоговая оценка PrimeScientist оказалась на 10,3% выше, чем у AutoResearch. Базовая система последовательно улучшает текущий вариант, тогда как PrimeScientist сохраняет конкурирующие объяснения и возвращается к ним по результатам экспериментов.
В повторных прогонах на шести задачах AutoLab средняя оценка двух систем практически совпала, но PrimeScientist использовал на 24% меньше попыток. Снижение сохранилось на каждой задаче этой части проверки, куда входили оптимизация операций с базами данных, численных вычислений и программ обработки данных.
На задаче о порядке обучения изображений дерево сохранило несколько объяснений наблюдаемого эффекта: ошибки в метках, особенности архитектуры и структуру изображений. PrimeScientist развивал ветки избирательно и достиг той же оценки за 12 попыток вместо 30. В дереве при этом остались как отброшенные варианты, так и подготовленные, но не запущенные эксперименты.
Проверка охватывала FIRE-Bench с исследовательскими вопросами об ИИ, AutoLab с системными задачами и оптимизацией кода, а также MLE-Bench с инженерными задачами машинного обучения. Основным соперником был AutoResearch, а бюджет токенов для планирования и исполнения выравнивали.
Бюджет не учитывал время работы CPU и GPU. Поэтому меньшее число полных попыток показывает экономию экспериментальных циклов, но не означает такое же процентное снижение облачного счёта: планирование дерева тоже расходует токены, а стоимость самого эксперимента зависит от задачи.
Когда эту схему стоит закладывать в архитектуру
Работа меняет планы команд, которые строят агента вокруг цикла «изменить код — запустить — измерить». Одной памяти о предыдущих шагах здесь недостаточно. Системе нужен постоянный реестр альтернативных планов, результатов и затрат, иначе политика не сможет сравнить возврат к старой ветке с продолжением текущей.
Второй необходимый компонент — единый учёт ресурсов. PrimeScientist списывает из одного бюджета токены агента, который составляет планы, и агента, который их исполняет. Это не позволяет бесконечно улучшать описание исследования, не оставляя ресурсов на проверку, или, наоборот, запускать серию слабо обоснованных изменений.
Политику выбора полезно отделить от исполнителя. В описанной системе исполнитель получает план, но не знает глобальный остаток бюджета. Решение о направлении и допустимой степени исследования принимает внешний слой. Благодаря этому кодовый агент можно заменить, не перестраивая дерево и правила распределения ресурсов.
Переписывать действующую систему целиком ради PrimeScientist рано. Практический первый шаг — сохранять несколько исполнимых вариантов, считать стоимость планирования вместе с исполнением и менять широту поиска по мере расходования бюджета. На процессах, где основную цену задают GPU, лабораторные установки или ручная проверка, потребуется другой учёт ресурсов: в работе политика оптимизирует единый бюджет токенов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



