Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Языковую модель научили отмечать, какие части ответа зависят друг от друга, и через эти отметки управлять собственным исполнением. В препринте Tian Jin, который не прошёл рецензирование и приводит замеры самого автора, все три прототипа улучшили соотношение качества и затрат по сравнению со специализированными базовыми методами. Для продуктовых команд это пока не готовая серверная платформа, а новый вариант архитектуры для систем, где задержка или память GPU уже ограничивают продукт.
Как смысл ответа превращают в план исполнения
Обычная авторегрессионная модель генерирует текст последовательно: каждый следующий токен формально зависит от всех предыдущих. Даже если два абзаца раскрывают независимые темы, сервер исполняет их один за другим и при небольшом числе одновременных запросов слабо загружает вычислительные блоки GPU.
Работа заменяет эту формальную цепочку графом смысловых зависимостей. Модель делит ответ на фрагменты и отмечает, какие из них можно создавать независимо, а каким нужны результаты предыдущих частей. Отдельная среда исполнения читает разметку и решает, что запускать параллельно, когда ждать соседнюю ветку и какой контекст уже можно удалить.
В PASTA модель вставляет специальные токены, которые обозначают независимые фрагменты и точки синхронизации. Среда исполнения запускает несколько потоков генерации, а затем объединяет их там, где ответ снова требует общего контекста. Модель сначала дообучают на размеченных ответах, затем оптимизируют одновременно по качеству и задержке.
TIP применяет ту же идею к памяти. Модель хранит ограниченный набор шагов рассуждения и отмечает те, на которые больше не сошлётся. Среда исполнения удаляет соответствующие записи из KV-кэша — памяти с промежуточными состояниями токенов, которую модель использует, чтобы не пересчитывать весь контекст на каждом шаге.
Planned Diffusion переносит смысловые зависимости в дискретную диффузию. Модель сначала последовательно составляет краткий план независимых фрагментов, затем восстанавливает их из масок параллельно. После очередной группы она обновляет план с учётом уже созданного текста.
Где ускорение сохранило качество, а где потребовало компромисса
PASTA ускорила генерацию в 1,21–1,93 раза. Качество на AlpacaEval при разных настройках менялось от роста на 2,2% до падения на 7,1%. Это не одна точка, а набор режимов: команда может сильнее распараллелить ответ и принять потерю качества либо выбрать более осторожную конфигурацию.
TIP сократила KV-кэш больше чем наполовину и при этом повысила точность на математических задачах. Она также обошла StreamingLLM и Paged H2O при сопоставимом бюджете памяти. В отличие от этих методов, TIP выбирает удаляемые шаги по содержанию рассуждения, а не по размеру окна или накопленному вниманию к токенам.
Planned Diffusion ускорила генерацию до 1,81 раза относительно авторегрессионного режима, но уступила ему по качеству. Выигрыш возникает не из одновременного восстановления произвольных токенов: модель сначала выделяет фрагменты, которые считает независимыми, и только затем обрабатывает их параллельно.
Три подхода проверяли раздельно. PASTA и Planned Diffusion оценивали на AlpacaEval, TIP — на двух наборах AIME; сравнения включали асинхронную генерацию, эвристику удаления контекста и обычное авторегрессионное исполнение. Это три самостоятельных прототипа с разными языками разметки и средами исполнения, а не единый механизм, который одновременно ускоряет декодирование, освобождает память и управляет диффузией.
Что меняется в архитектурных планах
Работа меняет прежде всего направление экспериментов. Если сервис упирается в задержку одного запроса, длинные рассуждения или размер KV-кэша, к вариантам оптимизации стоит добавить обучаемую разметку зависимостей. Она может находить параллельные ветви и ненужный контекст там, где регулярные выражения, фиксированное окно или показатели внимания видят только форму текста.
В производственный план такой подход добавляет связку из модели и специализированной среды исполнения. Недостаточно изменить подсказку или подключить другой алгоритм декодирования: PASTA требует специальных токенов и асинхронных потоков, TIP — управления KV-кэшем по командам модели, Planned Diffusion — отдельного цикла планирования и восстановления фрагментов. Эти компоненты придётся обучать, развёртывать и проверять вместе.
Главный риск переносится внутрь ответа. Если модель ошибочно объявит зависимые части независимыми, параллельность повредит связности или фактам; если TIP удалит нужный шаг, последующее рассуждение потеряет опору. Поэтому в прикладном испытании нужно измерять не только среднюю задержку и память, но и качество на тех типах запросов, где ветви ответа действительно сходятся.
Менять текущий серверный стек только на основании этой работы рано: общего формата разметки и единой среды исполнения в ней нет. Но для команд, которые уже дообучают собственную модель и контролируют её среду исполнения, смысловые зависимости становятся практической гипотезой для следующего цикла оптимизации, а не только способом описывать рассуждение.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



