Журнал · Rit.work

WMLLM учит агента прогнозировать результат до проверки решения

WMLLM совмещает модель мира, поиск по популяции решений и обучение с подкреплением, чтобы сокращать число бесполезных проверок при оптимизации чёрного ящика.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Zhongzheng Li и соавторы представили WMLLM — агента для оптимизации чёрного ящика, причём работа опубликована как не прошедший рецензирование препринт. На основном тесте площадь под кривой качества десяти лучших решений выросла на 13%: с 3,661 у OpenEvolve до 4,124 у WMLLM. Подход важен для команд, у которых проверка каждого варианта требует дорогого моделирования, лабораторного эксперимента или обращения к внешнему оценщику.

Что сделали

Оптимизация чёрного ящика означает, что алгоритм не знает внутренних правил системы и может только предлагать варианты и получать оценки. WMLLM меняет обычный цикл проб и ошибок: перед отправкой кандидата оценщику одна LLM прогнозирует его показатели, а после проверки сопоставляет прогноз с фактическим результатом.

Расхождение становится дополнительным сигналом обучения. Модель должна не только найти вариант с высокой оценкой, но и точнее представить связь между действием и результатом — это авторы называют неявной моделью мира. Отдельный модуль для неё не создаётся: прогноз и новое решение формирует одна политика.

Метод объединяет многошаговое уточнение через инструменты, поиск по популяции кандидатов и обучение с подкреплением GRPO. Агент сохраняет как лучшие решения, так и варианты из разных частей множества компромиссов между целями. В основном эксперименте он проектировал молекулы по нескольким конкурирующим свойствам при бюджете в 3000 проверок. По замерам авторов, обязательный прогноз улучшал результат сильнее, чем одно лишь увеличение модели или добавление многошаговой работы с инструментами.

Что это значит

Практический смысл — в возможности отсеивать слабые направления до дорогой внешней проверки и корректировать поиск по ошибкам собственных прогнозов. Это не устраняет обращения к оценщику: WMLLM по-прежнему обучается на повторяющейся обратной связи. Поэтому архитектура применима прежде всего там, где результат можно формализовать числовой функцией и автоматически вернуть агенту.

Ограничения. Основные выводы получены на многокритериальной оптимизации молекул; перенос проверяли лишь на нескольких структурированных задачах с бюджетом 100 обращений к оценщику и предварительно на ALFWorld. Работа не показывает эффективность в длительных производственных процессах с неоднозначной обратной связью. В сравнении учтено одинаковое число проверок кандидатов, но не сопоставлены время выполнения и вычислительные затраты методов; кроме того, доля корректных молекул у WMLLM ниже, чем у части специализированных подходов.

Источники

Иллюстрация: рисунок из статьи «WMLLM: Self-Evolving Optimization Agents via Predict-Then-Act World Modeling», Zhongzheng Li, Qingsong Ran, Shikun Feng и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу