Журнал · Rit.work

LEAP ускоряет LLM-агентов с помощью малой модели действий

LEAP обучает небольшую модель предлагать действия LLM-агента и ускоряет выполнение задач в 1,10–1,63 раза без систематического изменения успешности.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Последовательную работу LLM-агента удалось ускорить без замены основной модели и без ослабления проверки её действий. В препринте Zhen Xu и коллег, который не проходил рецензирование и где все числа получили сами авторы, LEAP ускорил полное выполнение задач в 1,10–1,63 раза. Метод имеет смысл там, где агент долго генерирует решения, а его действия повторяются достаточно часто, чтобы обучить отдельную малую модель.

Малая модель предлагает, основная принимает решение

Обычный агент выполняет задачу строго последовательно. Основная модель рассуждает, выбирает инструмент и аргументы, ждёт результат, добавляет его в контекст и только потом начинает следующий шаг.

LEAP добавляет черновую модель, которая заранее предлагает несколько следующих действий. Она работает без развёрнутого рассуждения: получает текущий контекст и выдаёт каноническое действие — название инструмента и аргументы в форме, которую ожидает агент.

Предложенные инструменты запускаются в копии среды, после чего основная модель параллельно проверяет контексты для нескольких возможных шагов. Система принимает совпавший префикс. При первом расхождении она использует действие основной модели, а оставшиеся проверки отменяет.

Поэтому черновая модель не получает права самостоятельно управлять агентом. Каждое зафиксированное действие совпадает с ответом основной модели для соответствующего контекста. Это сильнее обычной проверки формата, хотя и не гарантирует идентичную траекторию всего задания: параллельный запуск может повлиять на недетерминированные ответы модели.

Черновик обучают на парах «контекст — действие», которые создаёт сама основная модель. Текст её рассуждений отбрасывают, а небольшую модель дообучают через адаптер LoRA. Размеченные людьми действия и доступ к внутренним вероятностям основной модели не нужны.

Ускорение зависит не только от доли совпадений

Авторы раскладывают время одного спекулятивного раунда на три части: подготовку предложений, ожидание самой долгой проверки и выполнение инструментов. Выигрыш определяет число действий, которые агент успел зафиксировать за этот раунд.

Высокая точность черновика сама по себе не гарантирует ускорения. Большая модель чаще совпадает с основной, но может потратить на предложение почти всё сэкономленное время. Короткие задачи тоже мешают: если агент завершил работу на принятом действии, система не получает дополнительный шаг от основной модели.

После обучения Qwen3-0.6B совпадал с действиями Qwen3-32B в 64–75% случаев на разных наборах задач; до обучения совпадения составляли 2–25%. При этом увеличение черновой модели не всегда помогало: дополнительная точность могла не окупить более долгую генерацию.

Метод проверили на OpenAGI и TaskBench с планированием, а также на τ2-bench и BFCL с выполнением инструментов. Основными моделями служили Qwen3-32B и Gemma-4-31B-it, черновиками — три размера Qwen3. Обе модели работали на одном H100, поэтому результаты учитывают конкуренцию за ресурсы GPU, а не складывают задержки отдельных серверов.

На задачах с инструментами успешность не менялась систематически: в разных сравнениях она росла, падала или оставалась прежней, а разница не превышала трёх заданий. Это поддерживает заявленную гарантию на уровне действий, но не превращает LEAP в способ улучшить качество агента.

Командам потребуется адаптер под конкретного агента

LEAP меняет планы команд, у которых основную задержку создаёт генерация модели. Если агент большую часть времени ждёт внешнюю систему, базу данных или длительный инструмент, черновик не устранит этот расход: выполнение инструментов остаётся в критическом пути.

Обучать один универсальный черновик для всех агентов работа не предлагает. Перенос между OpenAGI и TaskBench оказался слабым по сравнению с обучением внутри одного набора задач. Практичная архитектура — отдельный адаптер для конкретной основной модели, набора инструментов и характерного потока запросов.

Сначала стоит измерить время основной генерации, инструментов и проверки, а затем оценить, сколько действий агент фиксирует за раунд. Доля совпадений без этих компонентов может привести к неверному выбору: более точный черновик способен оказаться медленнее небольшой специализированной модели.

Для запуска не обязательно заранее собирать полный набор трасс. LEAP может начать с необученного черновика, сохранять подтверждённые действия основной модели и обновлять адаптер по мере работы. Онлайн-обучение приблизилось к результату предварительного обучения, поэтому оптимизацию можно вводить после запуска агента, не меняя замороженную основную модель.

Инфраструктура при этом должна уметь изолированно выполнять предложенные действия и отменять ненужные проверки. Для инструментов с необратимыми внешними эффектами потребуется копия среды либо другой механизм безопасного воспроизведения. Без него схема из работы не переносится напрямую в производственный процесс.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу