Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Долгий запуск ИИ-агента можно останавливать раньше, если его недавний прогресс и профиль возможностей не обещают окупить следующий отрезок вычислений. При повторном воспроизведении накопленных траекторий правило сэкономило около трети времени, хотя работа не рецензирована и все числа получили сами авторы. Фиксированный лимит превращается в решение, которое система пересматривает после каждой контрольной точки.
Как прогнозировали отдачу от следующего шага
Работу подготовили специалисты Meituan LongCat Team, Zhejiang University, Westlake University, Allen Institute for AI и University of Washington. Они изучали агентов, которые часами решают исследовательские и инженерные задачи, запускают код, получают обратную связь и исправляют решение.
Обычная оценка показывает только итоговый балл. Здесь авторов интересовала вся траектория: сколько агент уже прибавил, когда произошёл последний прирост и продолжает ли дополнительное время улучшать проверяемый результат.
Сначала для каждой модели собрали профиль по внешним бенчмаркам. Связанные результаты сжали до нескольких главных компонентов — координат, которые описывают общие различия между моделями. Для каждой категории задач отдельно обучили две комбинации этих координат: одна предсказывает начальный уровень, другая — скорость дальнейшего роста.
Такое разделение нужно, потому что одинаковый старт ещё не означает одинаковую отдачу от вычислений. Две модели могут набрать близкий балл на ранней контрольной точке, но одна быстро выйти на плато, а другая продолжить улучшаться.
Рост описывает логистическая степенная кривая. Она учитывает насыщение: по мере приближения к верхней границе тот же объём вычислений приносит всё меньший прирост. Кривую обучают на ранних участках траекторий, а затем продолжают до полного бюджета.
Проверка охватила AutoLab и EdgeBench: 71 задачу в десяти категориях и десять версий моделей. AutoLab включает оптимизацию систем и CUDA-ядер, разработку моделей и задачи-головоломки; EdgeBench — математику, научные задачи, оптимизацию, работу со знаниями и программную инженерию. Для AutoLab использовали траектории отдельных запусков, для EdgeBench — опубликованные средние кривые по паре «задача — модель».
Средний балл скрывает сужение возможностей
Средний результат рос на каждом записанном интервале во всех категориях, но число моделей, которые ещё могли улучшить конкретную задачу, сокращалось. Между первым и последним интервалом их доля снизилась в среднем на 35,2 процентного пункта.
Это меняет трактовку среднего прироста. Поздний рост может обеспечивать небольшая часть моделей, тогда как остальные уже исчерпали полезные шаги. В области слабых приростов уменьшение ожидаемой прибавки вдвое оставляло около 30% прежней частоты улучшений.
Кривые, обученные на ранних контрольных точках, предсказывали поздние средние баллы со среднеквадратичной ошибкой 2,31 балла по шкале от нуля до ста. Модель использовала не только текущий результат, но и профиль возможностей: навыки, связанные с высоким итоговым баллом, не всегда совпадали с навыками, которые поддерживали дальнейший рост.
Из этих прогнозов авторы собрали последовательное правило. После каждой контрольной точки оно оценивает ближайший прирост и возможный прирост до конца бюджета. Следующий интервал запускается, если хотя бы один прогноз оправдывает стоимость вычислений; затем оценка повторяется.
При экономии времени, указанной в лиде, относительная потеря результата составила 2,4% на отдельных запусках AutoLab и 3,3% на средних кривых EdgeBench. Второй результат нельзя напрямую переносить на поведение отдельных запусков, поскольку в этой части эксперимента использовались усреднённые траектории.
Планы меняются в оркестрации, а не в выборе модели
Работа предлагает не новый способ обучать агента, а слой управления над существующей системой. Вместо единого лимита времени оркестратор сохраняет лучший проверенный балл на контрольных точках, оценивает ближайшую и отложенную пользу и решает, выделять ли следующий интервал.
Такой подход подходит продуктам, где качество можно измерять во время выполнения: оптимизаторам кода, исследовательским агентам, генераторам проверяемых решений и системам, которые многократно запускают тесты. Если промежуточный результат нельзя проверить, обучить сопоставимую кривую роста будет сложнее.
Для внедрения потребуется история запусков по сходным категориям задач и нескольким моделям. Историю целевой модели можно не использовать при обучении правила: в эксперименте её исключали, а решение принимали по внешнему профилю и уже наблюдаемому началу текущего запуска.
Не следует превращать один внешний бенчмарк в условие остановки. В работе результаты бенчмарков задают совместный профиль модели, а связи с поздним ростом показывают корреляцию, а не отдельную причину успеха.
Планируемый артефакт пока не позволяет полностью повторить результаты AutoLab: использованные авторами траектории отдельных запусков оставлены на редактирование. Поэтому практический шаг для команды — проверить правило на собственных журналах и выбрать цену вычислений исходя из экономики продукта, а не переносить готовый порог.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



