Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM-агенты лучше подбирают параметры и конструкции, чем модели, которые сразу предлагают очередной вариант. Команда Nanjing University получила средний выигрыш 30,3% над прямыми запросами к модели, хотя препринт не рецензирован и числа получили сами авторы. Для продуктовой команды вывод практический: сначала стоит дать агенту смысл параметров и свободу анализа, а не подключать больше готовых оптимизаторов.
Агент выигрывает за счёт управления поиском
Речь об оптимизации чёрного ящика (black-box optimization): система может проверить качество предложенного решения, но не знает формулу целевой функции и не получает её градиенты. Так подбирают гиперпараметры модели, конфигурацию базы данных, расположение блоков на чипе или структуру молекулы, когда каждая проверка требует времени или вычислений.
В обычной схеме LLM получает описание задачи и историю проверок, после чего сразу предлагает следующий вариант. Агент вместо этого хранит рабочее состояние между шагами, запускает Python, анализирует предыдущие результаты, обращается к численным методам и только затем отправляет решение на дорогую проверку.
AgenticBBO-Bench сводит в один протокол синтетические функции, подбор гиперпараметров, настройку баз данных, проектирование чипов и молекул. Все методы начинают с одинаковых наблюдений и получают одинаковый бюджет проверок целевой функции. Запуски модели, выполнение кода и обращения к инструментам этот бюджет не расходуют.
Итоговый балл учитывает не только лучшее найденное решение, но и весь путь к нему. Это отделяет метод, который быстро находит хороший участок, от метода с таким же финалом после длинной серии слабых попыток.
Агентная схема обошла прямые запросы во всех семействах задач и лучшие специализированные численные методы — в четырёх. Самый заметный выигрыш над прямой схемой пришёлся на синтетические функции и молекулярный дизайн: 43,7% и 48,7% соответственно. Результат не означает, что LLM заменяет оптимизатор: агент получает преимущество, когда сам решает, как исследовать историю и какой способ поиска применить следующим.
Смысл параметров полезнее готовых подсказок
Названия параметров и описание задачи дали устойчивый эффект. Когда входы были обезличены, средний балл составил 0,465; после раскрытия их смысла он вырос до 0,595. Модель могла учитывать, что именно регулирует параметр, какие значения совместимы и где вероятны ограничения.
Более подробные предметные подсказки сработали хуже: средний результат снизился до 0,569. Они помогли в отдельных задачах настройки базы данных и размещения блоков, но помешали в других. Контролируемый опыт подтвердил причину: полезна не сама подробность, а верное знание о том, какие переменные влияют на результат и как устроена область хороших решений; ошибочное указание важных переменных почти убрало выигрыш.
Дополнительный оптимизатор на основе гауссовского процесса тоже не улучшал поиск стабильно. Агент часто писал собственный анализ на Python вместо передачи задачи готовому инструменту. В примере с размещением блоков на чипе он построил линейную приближенную модель по уже проверенным вариантам, нашёл закономерность и использовал её для следующих размещений.
Это меняет приоритеты при проектировании системы. Структурированная история опытов, понятные имена переменных, единицы измерения, ограничения и возможность быстро написать расчётный код важнее длинного списка оптимизаторов. Предметные правила стоит добавлять только там, где команда может проверить их применимость к конкретной задаче.
LLM можно оставить только на разведочном этапе
Постоянное участие модели оказалось необязательным. Когда после начального агентного поиска работу передавали TuRBO, итоговый балл достигал 0,570 против 0,569 у агента, который управлял процессом до конца. TuRBO без подготовленной агентом траектории набрал 0,475.
Для рабочей системы отсюда следует гибридная архитектура. LLM получает описание задачи, изучает первые наблюдения, пишет вспомогательный код и находит перспективную область. Затем более предсказуемый и дешёвый численный метод продолжает поиск без постоянных вызовов модели.
Начинать стоит с минимальной агентной оболочки: постоянного рабочего пространства, запуска кода, структурированного доступа к истории и проверки формата кандидатов перед дорогим вычислением. Новые оптимизаторы и предметные подсказки лучше подключать по одному и сравнивать на собственном бюджете проверок.
Границы результатов задаёт сам стенд. Основные опыты проводили с DeepSeek V4.1 Flash в оболочке Codex, а отдельные выводы об инструментах, знаниях и роли LLM проверяли на поднаборах задач. В компактном сравнении моделей GPT-6 Astra и DeepSeek V4.1 Flash образовали границу качества и стоимости: первый показал лучший средний результат, второй подошёл близко при меньших официальных расходах на токены. Выбор модели поэтому не заменяет настройку всей поисковой системы.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



