Журнал · Rit.work

FreeEvolve заменяет фиксированный поиск обучаемой политикой

FreeEvolve сама планирует проверку и отбор конфигураций LLM-агента, а затем переносит выученный способ поиска между задачами и моделями.

Rit.work
Студия разработки
8 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систему улучшения LLM-агентов научили самой решать, какие изменения проверять, сколько раз повторять замеры и когда остановиться. В работе AWS AI Labs и Georgia Institute of Technology, которая не прошла рецензирование и содержит замеры самих авторов, FreeEvolve повысила итоговую метрику на отложенных задачах в среднем на 13,6 процентного пункта. Это позволяет менять стратегию поиска без ручной переделки цикла под каждую среду.

Обычные системы редактируют промпты, навыки и сценарии агента, но следуют заранее заданному порядку: запускают определённые тесты, сравнивают кандидатов по фиксированному правилу и останавливаются по установленному условию. В FreeEvolve среда задаёт цель, доступные данные, изменяемую конфигурацию и предел ресурсов. После запуска система сама выбирает задачи и кандидатов, назначает повторы, распределяет параллельные запуски и завершает поиск.

Эти решения записаны в редактируемом навыке эволюции. Чтобы улучшить сам навык, FreeEvolve запускает с его кандидатными версиями полные кампании и оценивает получившихся агентов, а не текст инструкций отдельно. После такого обучения навык дал на новых агентах ещё 6,9 пункта относительно исходной, написанной вручную версии и переносился между средами без исходных агентов и журналов запусков.

На отложенных наборах FreeEvolve сравнили с GEPA, OpenEvolve, EvoX и HyperAgents. Она сравнялась с ними или обошла их по шести из семи метрик. Отдельный опыт показал, зачем системе нужен контроль над кампанией: когда её заставляли всегда проверять полный набор задач, средний результат на τ3-bench падал с 47,1% до 39,1%.

Проверка охватила τ3-bench, ARC-AGI-2, ARC-AGI-3 и Terminal-Bench 2.1: диалоговых агентов, абстрактные задачи и работу в терминале. Во всех ролях использовали модели Claude, а кампанией управлял Claude Code; точное выравнивание затрат с другими методами не проводили, поскольку они по-разному распределяют вычисления. Поэтому работа показывает переносимость политики поиска внутри этого набора сред, но пока не доказывает такой же эффект для других семейств моделей.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу