Журнал · Rit.work

Модель сама задаёт порядок исполнения ответа

Три прототипа используют смысловые зависимости в ответе, чтобы параллельно генерировать текст, очищать KV-кэш и планировать диффузию.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковую модель научили отмечать, какие части ответа зависят друг от друга, и через эти отметки управлять собственным исполнением. В препринте Tian Jin, который не прошёл рецензирование и приводит замеры самого автора, все три прототипа улучшили соотношение качества и затрат по сравнению со специализированными базовыми методами. Для продуктовых команд это пока не готовая серверная платформа, а новый вариант архитектуры для систем, где задержка или память GPU уже ограничивают продукт.

Как смысл ответа превращают в план исполнения

Обычная авторегрессионная модель генерирует текст последовательно: каждый следующий токен формально зависит от всех предыдущих. Даже если два абзаца раскрывают независимые темы, сервер исполняет их один за другим и при небольшом числе одновременных запросов слабо загружает вычислительные блоки GPU.

Работа заменяет эту формальную цепочку графом смысловых зависимостей. Модель делит ответ на фрагменты и отмечает, какие из них можно создавать независимо, а каким нужны результаты предыдущих частей. Отдельная среда исполнения читает разметку и решает, что запускать параллельно, когда ждать соседнюю ветку и какой контекст уже можно удалить.

В PASTA модель вставляет специальные токены, которые обозначают независимые фрагменты и точки синхронизации. Среда исполнения запускает несколько потоков генерации, а затем объединяет их там, где ответ снова требует общего контекста. Модель сначала дообучают на размеченных ответах, затем оптимизируют одновременно по качеству и задержке.

TIP применяет ту же идею к памяти. Модель хранит ограниченный набор шагов рассуждения и отмечает те, на которые больше не сошлётся. Среда исполнения удаляет соответствующие записи из KV-кэша — памяти с промежуточными состояниями токенов, которую модель использует, чтобы не пересчитывать весь контекст на каждом шаге.

Planned Diffusion переносит смысловые зависимости в дискретную диффузию. Модель сначала последовательно составляет краткий план независимых фрагментов, затем восстанавливает их из масок параллельно. После очередной группы она обновляет план с учётом уже созданного текста.

Где ускорение сохранило качество, а где потребовало компромисса

PASTA ускорила генерацию в 1,21–1,93 раза. Качество на AlpacaEval при разных настройках менялось от роста на 2,2% до падения на 7,1%. Это не одна точка, а набор режимов: команда может сильнее распараллелить ответ и принять потерю качества либо выбрать более осторожную конфигурацию.

TIP сократила KV-кэш больше чем наполовину и при этом повысила точность на математических задачах. Она также обошла StreamingLLM и Paged H2O при сопоставимом бюджете памяти. В отличие от этих методов, TIP выбирает удаляемые шаги по содержанию рассуждения, а не по размеру окна или накопленному вниманию к токенам.

Planned Diffusion ускорила генерацию до 1,81 раза относительно авторегрессионного режима, но уступила ему по качеству. Выигрыш возникает не из одновременного восстановления произвольных токенов: модель сначала выделяет фрагменты, которые считает независимыми, и только затем обрабатывает их параллельно.

Три подхода проверяли раздельно. PASTA и Planned Diffusion оценивали на AlpacaEval, TIP — на двух наборах AIME; сравнения включали асинхронную генерацию, эвристику удаления контекста и обычное авторегрессионное исполнение. Это три самостоятельных прототипа с разными языками разметки и средами исполнения, а не единый механизм, который одновременно ускоряет декодирование, освобождает память и управляет диффузией.

Что меняется в архитектурных планах

Работа меняет прежде всего направление экспериментов. Если сервис упирается в задержку одного запроса, длинные рассуждения или размер KV-кэша, к вариантам оптимизации стоит добавить обучаемую разметку зависимостей. Она может находить параллельные ветви и ненужный контекст там, где регулярные выражения, фиксированное окно или показатели внимания видят только форму текста.

В производственный план такой подход добавляет связку из модели и специализированной среды исполнения. Недостаточно изменить подсказку или подключить другой алгоритм декодирования: PASTA требует специальных токенов и асинхронных потоков, TIP — управления KV-кэшем по командам модели, Planned Diffusion — отдельного цикла планирования и восстановления фрагментов. Эти компоненты придётся обучать, развёртывать и проверять вместе.

Главный риск переносится внутрь ответа. Если модель ошибочно объявит зависимые части независимыми, параллельность повредит связности или фактам; если TIP удалит нужный шаг, последующее рассуждение потеряет опору. Поэтому в прикладном испытании нужно измерять не только среднюю задержку и память, но и качество на тех типах запросов, где ветви ответа действительно сходятся.

Менять текущий серверный стек только на основании этой работы рано: общего формата разметки и единой среды исполнения в ней нет. Но для команд, которые уже дообучают собственную модель и контролируют её среду исполнения, смысловые зависимости становятся практической гипотезой для следующего цикла оптимизации, а не только способом описывать рассуждение.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу