Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Zhongzheng Li и соавторы представили WMLLM — агента для оптимизации чёрного ящика, причём работа опубликована как не прошедший рецензирование препринт. На основном тесте площадь под кривой качества десяти лучших решений выросла на 13%: с 3,661 у OpenEvolve до 4,124 у WMLLM. Подход важен для команд, у которых проверка каждого варианта требует дорогого моделирования, лабораторного эксперимента или обращения к внешнему оценщику.
Что сделали
Оптимизация чёрного ящика означает, что алгоритм не знает внутренних правил системы и может только предлагать варианты и получать оценки. WMLLM меняет обычный цикл проб и ошибок: перед отправкой кандидата оценщику одна LLM прогнозирует его показатели, а после проверки сопоставляет прогноз с фактическим результатом.
Расхождение становится дополнительным сигналом обучения. Модель должна не только найти вариант с высокой оценкой, но и точнее представить связь между действием и результатом — это авторы называют неявной моделью мира. Отдельный модуль для неё не создаётся: прогноз и новое решение формирует одна политика.
Метод объединяет многошаговое уточнение через инструменты, поиск по популяции кандидатов и обучение с подкреплением GRPO. Агент сохраняет как лучшие решения, так и варианты из разных частей множества компромиссов между целями. В основном эксперименте он проектировал молекулы по нескольким конкурирующим свойствам при бюджете в 3000 проверок. По замерам авторов, обязательный прогноз улучшал результат сильнее, чем одно лишь увеличение модели или добавление многошаговой работы с инструментами.
Что это значит
Практический смысл — в возможности отсеивать слабые направления до дорогой внешней проверки и корректировать поиск по ошибкам собственных прогнозов. Это не устраняет обращения к оценщику: WMLLM по-прежнему обучается на повторяющейся обратной связи. Поэтому архитектура применима прежде всего там, где результат можно формализовать числовой функцией и автоматически вернуть агенту.
Ограничения. Основные выводы получены на многокритериальной оптимизации молекул; перенос проверяли лишь на нескольких структурированных задачах с бюджетом 100 обращений к оценщику и предварительно на ALFWorld. Работа не показывает эффективность в длительных производственных процессах с неоднозначной обратной связью. В сравнении учтено одинаковое число проверок кандидатов, но не сопоставлены время выполнения и вычислительные затраты методов; кроме того, доля корректных молекул у WMLLM ниже, чем у части специализированных подходов.
Источники
Иллюстрация: рисунок из статьи «WMLLM: Self-Evolving Optimization Agents via Predict-Then-Act World Modeling», Zhongzheng Li, Qingsong Ran, Shikun Feng и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



