Журнал · Rit.work

AgenticBBO-Bench: смысл задачи важнее набора оптимизаторов

AgenticBBO-Bench показывает, когда LLM-агент обходит прямые запросы и численные методы, зачем ему смысл параметров и почему дополнительные оптимизаторы помогают не всегда.

Rit.work
Студия разработки
9 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM-агенты лучше подбирают параметры и конструкции, чем модели, которые сразу предлагают очередной вариант. Команда Nanjing University получила средний выигрыш 30,3% над прямыми запросами к модели, хотя препринт не рецензирован и числа получили сами авторы. Для продуктовой команды вывод практический: сначала стоит дать агенту смысл параметров и свободу анализа, а не подключать больше готовых оптимизаторов.

Агент выигрывает за счёт управления поиском

Речь об оптимизации чёрного ящика (black-box optimization): система может проверить качество предложенного решения, но не знает формулу целевой функции и не получает её градиенты. Так подбирают гиперпараметры модели, конфигурацию базы данных, расположение блоков на чипе или структуру молекулы, когда каждая проверка требует времени или вычислений.

В обычной схеме LLM получает описание задачи и историю проверок, после чего сразу предлагает следующий вариант. Агент вместо этого хранит рабочее состояние между шагами, запускает Python, анализирует предыдущие результаты, обращается к численным методам и только затем отправляет решение на дорогую проверку.

AgenticBBO-Bench сводит в один протокол синтетические функции, подбор гиперпараметров, настройку баз данных, проектирование чипов и молекул. Все методы начинают с одинаковых наблюдений и получают одинаковый бюджет проверок целевой функции. Запуски модели, выполнение кода и обращения к инструментам этот бюджет не расходуют.

Итоговый балл учитывает не только лучшее найденное решение, но и весь путь к нему. Это отделяет метод, который быстро находит хороший участок, от метода с таким же финалом после длинной серии слабых попыток.

Агентная схема обошла прямые запросы во всех семействах задач и лучшие специализированные численные методы — в четырёх. Самый заметный выигрыш над прямой схемой пришёлся на синтетические функции и молекулярный дизайн: 43,7% и 48,7% соответственно. Результат не означает, что LLM заменяет оптимизатор: агент получает преимущество, когда сам решает, как исследовать историю и какой способ поиска применить следующим.

Смысл параметров полезнее готовых подсказок

Названия параметров и описание задачи дали устойчивый эффект. Когда входы были обезличены, средний балл составил 0,465; после раскрытия их смысла он вырос до 0,595. Модель могла учитывать, что именно регулирует параметр, какие значения совместимы и где вероятны ограничения.

Более подробные предметные подсказки сработали хуже: средний результат снизился до 0,569. Они помогли в отдельных задачах настройки базы данных и размещения блоков, но помешали в других. Контролируемый опыт подтвердил причину: полезна не сама подробность, а верное знание о том, какие переменные влияют на результат и как устроена область хороших решений; ошибочное указание важных переменных почти убрало выигрыш.

Дополнительный оптимизатор на основе гауссовского процесса тоже не улучшал поиск стабильно. Агент часто писал собственный анализ на Python вместо передачи задачи готовому инструменту. В примере с размещением блоков на чипе он построил линейную приближенную модель по уже проверенным вариантам, нашёл закономерность и использовал её для следующих размещений.

Это меняет приоритеты при проектировании системы. Структурированная история опытов, понятные имена переменных, единицы измерения, ограничения и возможность быстро написать расчётный код важнее длинного списка оптимизаторов. Предметные правила стоит добавлять только там, где команда может проверить их применимость к конкретной задаче.

LLM можно оставить только на разведочном этапе

Постоянное участие модели оказалось необязательным. Когда после начального агентного поиска работу передавали TuRBO, итоговый балл достигал 0,570 против 0,569 у агента, который управлял процессом до конца. TuRBO без подготовленной агентом траектории набрал 0,475.

Для рабочей системы отсюда следует гибридная архитектура. LLM получает описание задачи, изучает первые наблюдения, пишет вспомогательный код и находит перспективную область. Затем более предсказуемый и дешёвый численный метод продолжает поиск без постоянных вызовов модели.

Начинать стоит с минимальной агентной оболочки: постоянного рабочего пространства, запуска кода, структурированного доступа к истории и проверки формата кандидатов перед дорогим вычислением. Новые оптимизаторы и предметные подсказки лучше подключать по одному и сравнивать на собственном бюджете проверок.

Границы результатов задаёт сам стенд. Основные опыты проводили с DeepSeek V4.1 Flash в оболочке Codex, а отдельные выводы об инструментах, знаниях и роли LLM проверяли на поднаборах задач. В компактном сравнении моделей GPT-6 Astra и DeepSeek V4.1 Flash образовали границу качества и стоимости: первый показал лучший средний результат, второй подошёл близко при меньших официальных расходах на токены. Выбор модели поэтому не заменяет настройку всей поисковой системы.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу