Журнал · Rit.work

Глубокий префикс для мелкого черновика: как устроен DAS-Wave

DAS-Wave отделяет глубину чернового вычисления от глубины контекста и ускоряет генерацию рекуррентных трансформеров без изменения результата жадного декодирования.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Черновик для рекуррентного трансформера можно считать на малой глубине, но давать ему уже уточнённый контекст из полного прохода: так генерация ускоряется без изменения результата жадного декодирования. Работа Guanghao Li и коллег пока не рецензирована, а приведённые числа получили сами авторы; DAS-Wave показал среднее ускорение в 4,00–6,96 раза относительно обычной генерации токен за токеном.

Почему мелкому черновику помогает глубокий префикс

Рекуррентный трансформер многократно применяет один общий блок слоёв. Это позволяет увеличить вычислительную глубину без пропорционального роста числа параметров, но каждый новый токен приходится проводить через последовательность повторных вычислений.

Декодирование с собственным черновиком сокращает эту задержку. Модель сначала дешёво предлагает несколько следующих токенов на малой глубине, затем выполняет полный проход и проверяет их вместе. Совпавшие токены принимаются, а при первом расхождении модель отбрасывает остаток черновика и продолжает с результатом полного прохода.

Обычная схема связывает две глубины: на какой глубине рассчитан черновик и с какой глубины он читает представления уже подтверждённого префикса. Работа показывает, что эта связь не обязательна.

В механизме внимания запрос определяет, что искать, ключ помогает выбрать нужную позицию, а значение переносит содержимое из неё. Запросы и ключи приближаются к итоговому представлению раньше значений. Поэтому мелкий черновик уже умеет выбирать нужные части контекста, но извлекает из них ещё недостаточно уточнённое содержимое.

На Huginn замена только значений префикса на версии из полного прохода повысила совпадение черновых и итоговых токенов с 47,22% до 66,93%. Дополнительные рекуррентные проходы для этого не нужны: глубокие значения уже появились, когда модель проверяла предыдущий блок токенов, и их можно сохранить в кеше.

Авторы называют этот приём Mature-V. Более общий принцип DAS позволяет независимо выбирать глубину вычисления черновика и глубину ключей и значений, которые он читает из подтверждённого префикса.

DAS-Wave совмещает зрелый кеш и параллельное уточнение

Одного точного черновика недостаточно для высокого ускорения. Если модель предлагает токены последовательно, стоимость построения блока может съесть выигрыш от общей проверки. DAS-Wave уточняет несколько позиций параллельно и постепенно расширяет черновой блок.

Скрытые состояния позиций сохраняются между раундами. Модель не начинает вычисление заново после каждого изменения предполагаемого токена, а продолжает уточнять уже накопленное состояние. Новые позиции добавляются по мере роста блока.

В этой схеме лучше работают совместно глубокие ключи и значения. По отдельности перенос состояний между раундами и чтение зрелого кеша давали небольшой эффект, а вместе ускорили Huginn на GSM8K в 4,11 раза. Значит, выигрыш создаёт не один трюк с кешем, а согласованная работа двух механизмов.

После уточнения независимый полный проход проверяет предложенные токены. Он не получает скрытые состояния черновика и выполняет обычные вычисления целевой модели. Поэтому при жадном выборе токенов DAS-Wave сохраняет результат исходного декодирования в точной арифметике: меняется способ построения предложений, но не правило их принятия.

Увеличивать объём черновых вычислений бесконечно невыгодно. Более тщательно уточнённый блок может дать больше принятых токенов, но потратить на их подготовку столько времени, что итоговая скорость снизится. Для внедрения придётся настраивать ширину блока и число раундов под конкретную модель и оборудование, а не максимизировать только долю принятых предложений.

Когда работа меняет архитектурный план

Подход применим, если модель повторно использует блок слоёв, выдаёт промежуточные предсказания и позволяет хранить ключи и значения префикса отдельно для разных глубин. Для такой системы стоит развязать интерфейсы черновика и кеша: мелкий проход не обязан читать представления того же вычислительного возраста.

DAS не требует дополнительного обучения модели, но затрагивает контур вывода. Система должна сохранять глубокий кеш подтверждённого префикса, поддерживать чтение между глубинами и запускать независимую полную проверку. DAS-Wave дополнительно требует параллельного уточнения кандидатов и переноса их скрытых состояний.

Метод проверяли на четырёх рекуррентных контрольных точках Huginn и Raven с 32 повторными проходами. В оценку вошли математические задачи GSM8K и MATH-500, а также генерация кода HumanEval и MBPP; на каждую пару модели и задачи брали 40 запросов. Основные замеры проводили с жадным декодированием, пакетом из одного запроса и одной NVIDIA L20X, включая первичную обработку входного текста.

Эти условия делают результат наиболее полезным для команд, которые контролируют архитектуру модели и собственный стек вывода. Для обычного трансформера без рекуррентной глубины DAS-Wave не даёт готовой замены декодеру: его преимущество возникает именно там, где полный проход уже создаёт более зрелый префикс, а мелкий черновик может использовать его повторно.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу