Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Систему улучшения LLM-агентов научили самой решать, какие изменения проверять, сколько раз повторять замеры и когда остановиться. В работе AWS AI Labs и Georgia Institute of Technology, которая не прошла рецензирование и содержит замеры самих авторов, FreeEvolve повысила итоговую метрику на отложенных задачах в среднем на 13,6 процентного пункта. Это позволяет менять стратегию поиска без ручной переделки цикла под каждую среду.
Обычные системы редактируют промпты, навыки и сценарии агента, но следуют заранее заданному порядку: запускают определённые тесты, сравнивают кандидатов по фиксированному правилу и останавливаются по установленному условию. В FreeEvolve среда задаёт цель, доступные данные, изменяемую конфигурацию и предел ресурсов. После запуска система сама выбирает задачи и кандидатов, назначает повторы, распределяет параллельные запуски и завершает поиск.
Эти решения записаны в редактируемом навыке эволюции. Чтобы улучшить сам навык, FreeEvolve запускает с его кандидатными версиями полные кампании и оценивает получившихся агентов, а не текст инструкций отдельно. После такого обучения навык дал на новых агентах ещё 6,9 пункта относительно исходной, написанной вручную версии и переносился между средами без исходных агентов и журналов запусков.
На отложенных наборах FreeEvolve сравнили с GEPA, OpenEvolve, EvoX и HyperAgents. Она сравнялась с ними или обошла их по шести из семи метрик. Отдельный опыт показал, зачем системе нужен контроль над кампанией: когда её заставляли всегда проверять полный набор задач, средний результат на τ3-bench падал с 47,1% до 39,1%.
Проверка охватила τ3-bench, ARC-AGI-2, ARC-AGI-3 и Terminal-Bench 2.1: диалоговых агентов, абстрактные задачи и работу в терминале. Во всех ролях использовали модели Claude, а кампанией управлял Claude Code; точное выравнивание затрат с другими методами не проводили, поскольку они по-разному распределяют вычисления. Поэтому работа показывает переносимость политики поиска внутри этого набора сред, но пока не доказывает такой же эффект для других семейств моделей.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



