Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Последовательную работу LLM-агента удалось ускорить без замены основной модели и без ослабления проверки её действий. В препринте Zhen Xu и коллег, который не проходил рецензирование и где все числа получили сами авторы, LEAP ускорил полное выполнение задач в 1,10–1,63 раза. Метод имеет смысл там, где агент долго генерирует решения, а его действия повторяются достаточно часто, чтобы обучить отдельную малую модель.
Малая модель предлагает, основная принимает решение
Обычный агент выполняет задачу строго последовательно. Основная модель рассуждает, выбирает инструмент и аргументы, ждёт результат, добавляет его в контекст и только потом начинает следующий шаг.
LEAP добавляет черновую модель, которая заранее предлагает несколько следующих действий. Она работает без развёрнутого рассуждения: получает текущий контекст и выдаёт каноническое действие — название инструмента и аргументы в форме, которую ожидает агент.
Предложенные инструменты запускаются в копии среды, после чего основная модель параллельно проверяет контексты для нескольких возможных шагов. Система принимает совпавший префикс. При первом расхождении она использует действие основной модели, а оставшиеся проверки отменяет.
Поэтому черновая модель не получает права самостоятельно управлять агентом. Каждое зафиксированное действие совпадает с ответом основной модели для соответствующего контекста. Это сильнее обычной проверки формата, хотя и не гарантирует идентичную траекторию всего задания: параллельный запуск может повлиять на недетерминированные ответы модели.
Черновик обучают на парах «контекст — действие», которые создаёт сама основная модель. Текст её рассуждений отбрасывают, а небольшую модель дообучают через адаптер LoRA. Размеченные людьми действия и доступ к внутренним вероятностям основной модели не нужны.
Ускорение зависит не только от доли совпадений
Авторы раскладывают время одного спекулятивного раунда на три части: подготовку предложений, ожидание самой долгой проверки и выполнение инструментов. Выигрыш определяет число действий, которые агент успел зафиксировать за этот раунд.
Высокая точность черновика сама по себе не гарантирует ускорения. Большая модель чаще совпадает с основной, но может потратить на предложение почти всё сэкономленное время. Короткие задачи тоже мешают: если агент завершил работу на принятом действии, система не получает дополнительный шаг от основной модели.
После обучения Qwen3-0.6B совпадал с действиями Qwen3-32B в 64–75% случаев на разных наборах задач; до обучения совпадения составляли 2–25%. При этом увеличение черновой модели не всегда помогало: дополнительная точность могла не окупить более долгую генерацию.
Метод проверили на OpenAGI и TaskBench с планированием, а также на τ2-bench и BFCL с выполнением инструментов. Основными моделями служили Qwen3-32B и Gemma-4-31B-it, черновиками — три размера Qwen3. Обе модели работали на одном H100, поэтому результаты учитывают конкуренцию за ресурсы GPU, а не складывают задержки отдельных серверов.
На задачах с инструментами успешность не менялась систематически: в разных сравнениях она росла, падала или оставалась прежней, а разница не превышала трёх заданий. Это поддерживает заявленную гарантию на уровне действий, но не превращает LEAP в способ улучшить качество агента.
Командам потребуется адаптер под конкретного агента
LEAP меняет планы команд, у которых основную задержку создаёт генерация модели. Если агент большую часть времени ждёт внешнюю систему, базу данных или длительный инструмент, черновик не устранит этот расход: выполнение инструментов остаётся в критическом пути.
Обучать один универсальный черновик для всех агентов работа не предлагает. Перенос между OpenAGI и TaskBench оказался слабым по сравнению с обучением внутри одного набора задач. Практичная архитектура — отдельный адаптер для конкретной основной модели, набора инструментов и характерного потока запросов.
Сначала стоит измерить время основной генерации, инструментов и проверки, а затем оценить, сколько действий агент фиксирует за раунд. Доля совпадений без этих компонентов может привести к неверному выбору: более точный черновик способен оказаться медленнее небольшой специализированной модели.
Для запуска не обязательно заранее собирать полный набор трасс. LEAP может начать с необученного черновика, сохранять подтверждённые действия основной модели и обновлять адаптер по мере работы. Онлайн-обучение приблизилось к результату предварительного обучения, поэтому оптимизацию можно вводить после запуска агента, не меняя замороженную основную модель.
Инфраструктура при этом должна уметь изолированно выполнять предложенные действия и отменять ненужные проверки. Для инструментов с необратимыми внешними эффектами потребуется копия среды либо другой механизм безопасного воспроизведения. Без него схема из работы не переносится напрямую в производственный процесс.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



