Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Короткая текстовая инструкция заставила языковую модель заметно лучше искать минимум дорогой функции при малом числе попыток. Хотя работа команды Yi Wu не рецензирована и числа в ней получили сами авторы, Harness A из 197 слов снизил итоговый разрыв до оптимума у Gemini Flash на 48%. Исполняемый код здесь нужен для обучения стратегии, но разворачивать её затем можно как обычный текст.
Код превратил рассуждения модели в проверяемую стратегию
Работа посвящена оптимизации чёрного ящика (black-box optimization): системе нужно найти минимум неизвестной функции, которую можно только вызывать в выбранных точках. Каждый вызов может стоить денег или времени, поэтому модель должна выбирать между исследованием новых областей и уточнением уже найденного решения.
Без специальной инструкции языковая модель видит историю вызовов и предлагает следующую точку. Она может описать разумную эвристику словами, но часто плохо выполняет её как последовательный численный алгоритм.
Авторы перевели обучение в режим самоигры. Агент начинал с работающей программы оптимизатора, изучал её код, результаты и прошлые ошибки, а затем писал программу-соперника. Обе версии запускали на одинаковых свежих функциях; новую сохраняли, только если она исполнялась без ошибок и находила решения лучше.
В журнал попадали исходный код, траектории поиска, оценки, сбои и решения о выборе победителя. Благодаря этому гипотезы вроде «сначала исследовать координаты по отдельности» переставали быть свободным рассуждением: агенту приходилось выразить их в коде и проверить на функции.
После практики лучшая программа проходила отдельный контроль на новых исходных данных. Если она выдерживала проверку, модель один раз получала программу и весь журнал, а затем сжимала найденную стратегию в текстовую обвязку (harness). Авторы не перебирали альтернативные формулировки после этого шага: текст, интерфейс, разбор ответа и настройки модели фиксировали до итоговых испытаний.
Такое разделение закрывает распространённую лазейку в автоматической настройке инструкций. Результаты контрольных задач не могут постепенно просочиться в текст, потому что после фиксации меняется только история вызовов неизвестной функции.
Текст перенёсся между моделями и новыми функциями
Публичные испытания давали оптимизатору бюджет в 20 последовательных вызовов. Основные сравнения проводили на 10 парных задачах, а центральную проверку Gemini Flash повторили на 30. Практика проходила на случайно сдвинутых квадратичных функциях, а итоговая проверка включала незнакомые ландшафты BBOB Bent Cigar, Gallagher-101 и Rastrigin.
Замороженный Harness A улучшил средний результат у всех протестированных исполнителей Gemini. Тот же текст перенесли без правок на Claude Sonnet: итоговый разрыв до оптимума снизился на 43% на квадратичных функциях и на 49% на сдвинутом Rastrigin. Обе разницы сохранились после поправки на множественные сравнения.
На каждом из проверенных ландшафтов BBOB средний результат тоже улучшился, но после статистической поправки уверенно выделялся только Gallagher. Поэтому работа показывает перенос в диапазон байесовской оптимизации, а не превосходство над ней. На отдельных задачах сохранённая программа из этапа практики оставалась лучше текстовой версии.
Независимый повтор всего процесса дал Harness B. Он вырос из другой программы поиска и не разделял с Harness A ни одного предложения, но попал в тот же диапазон качества на свежих функциях. Это указывает, что переносится не конкретная формулировка или реализация, а дисциплина расходования доступных вызовов.
Работа добавляет этап обучения, но не отменяет классические оптимизаторы
Для продукта вывод состоит не в том, чтобы заменить байесовскую оптимизацию вызовом LLM. Работа предлагает другой архитектурный приём: на этапе разработки модель пишет и испытывает алгоритмы, после чего команда фиксирует найденную политику как текстовый артефакт. Его проще переносить между исполнителями, чем программу, привязанную к конкретной среде выполнения.
Такой процесс стоит отделить от итоговой оценки. Нужны внешние тренировочные функции, исполняемый критерий допуска, неизменяемая инструкция и манифест с настройками модели. Каждого нового исполнителя всё равно придётся сравнивать с базовой моделью и классическим оптимизатором: одна и та же подсказка в экспериментах помогала разным моделям неодинаково, а обычная рекомендация по оптимизации иногда даже ухудшала результат.
Публичная часть работы охватывает одну размерность задачи, один бюджет вызовов и только одного дополнительного поставщика моделей. На закрытом benchmark настройки наград YouTube итоговый разрыв Harness B составил 0,0495 против 0,0894 у Google Vizier, однако оба значения получены повторной выборкой из одного исторического набора, а не независимыми производственными испытаниями.
Менять основной численный стек только по этой работе рано. Но если LLM уже выбирает параметры дорогого симулятора, эксперимента или бизнес-правила, планы стоит дополнить исполняемой практикой и последующим сжатием стратегии в замороженный текст. Это даёт проверяемый путь от свободных рассуждений модели к политике, которую можно аудировать и переносить.
Источники
Иллюстрация: рисунок из статьи «Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization», Yi Wu, Zheng Ren, Zhiyu Hu и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



