Журнал · Rit.work

BLD ускоряет диффузионную генерацию текста через скрытые блоки

BLD сжимает состояние диффузионной модели, восстанавливает блоки текста параллельно и выигрывает в скорости, но пока хуже удерживает смысл длинного документа.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Длинный текст научились генерировать с меньшим объёмом последовательных вычислений. В препринте Georgia Institute of Technology, Writer AI Research и William & Mary, который не прошёл рецензирование, а все числа в нём получили сами авторы, метод BLD сократил вычисления более чем в 80 раз относительно сопоставимой диффузионной модели. Подход может изменить архитектуру сервисов с большим потоком длинных генераций, но пока не заменяет обычные LLM в задачах, где важен связный документ целиком.

Модель очищает короткую последовательность скрытых блоков

Авторегрессионная языковая модель пишет текст по одному токену. Диффузионная модель обновляет много позиций параллельно, но обычно хранит отдельное состояние для каждого токена и на каждом шаге снова обрабатывает всю длину ответа. Параллельность уменьшает число последовательных шагов, но не сокращает саму обрабатываемую последовательность.

BLD меняет единицу генерации. Кодировщик превращает последовательность из 1024 токенов в 64 скрытых блока — сжатие в 16 раз. Каждый блок соответствует непрерывному фрагменту текста, но получает контекст всего документа, поэтому несёт не только локальные сведения.

Сразу сгенерировать все сильно сжатые блоки оказалось трудно: текст сохранял локальную беглость, но терял содержание на больших расстояниях. Поэтому BLD создаёт скрытые блоки группами. В основной конфигурации модель совместно очищает восемь блоков, фиксирует результат и использует его как контекст для следующей группы.

После этого отдельный декодер превращает каждый скрытый блок в токены. Внутри ветки он работает авторегрессионно, зато все ветки запускаются одновременно и сверяются с полной последовательностью скрытых блоков. При равномерном разбиении последовательная глубина этого этапа составляет около 16 шагов вместо прохода по всему документу.

Сжатие само по себе такого выигрыша не дало бы. Если после короткой диффузионной последовательности использовать обычный декодер, который пишет весь текст токен за токеном, узкое место просто переместится в конец конвейера. BLD ускоряет генерацию именно сочетанием сжатого состояния и параллельных локальных веток.

Пропускная способность выросла, глобальная связность отстала

На одном и том же GPU BLD обошёл близкую по размеру модель ELF-L более чем в шесть раз по числу готовых документов за единицу времени. Однако задержка для одного документа оказалась немного выше, чем у ELF-L: последовательная генерация групп скрытых блоков мешает превратить весь выигрыш в ускорение одиночного запроса.

По сравнению с авторегрессионной базовой моделью BLD также показал более чем шестикратную пропускную способность и более чем четырёхкратное сокращение задержки. Это различие важно для эксплуатации: первый показатель описывает пакетную обработку, второй — время ожидания отдельного запроса. Снижение числа операций само по себе не гарантирует такое же снижение стоимости, поскольку она зависит от загрузки GPU и режима обслуживания.

Качество оценивали по перплексии сгенерированного текста, его разнообразию и MAUVE — метрике сходства распределений машинных и исходных текстов. BLD сохранил конкурентную локальную беглость и разнообразие, но уступил сильнейшим токеновым диффузионным моделям по части автоматических оценок. Главная нерешённая проблема — смысловые связи между удалёнными фрагментами документа.

Проверка охватывает безусловную генерацию на OpenWebText при одной длине последовательности, одной степени сжатия и одном масштабе модели. Сравнение с ELF и дискретными диффузионными моделями не полностью контролируемое: различаются токенизаторы и объёмы обучения. Человеческой оценки и отдельной метрики глобальной связности в эксперименте нет.

Архитектура интересна для пакетной генерации, но не готова стать базовой

Работа меняет планы команд, у которых стоимость определяет длинная пакетная генерация: создание вариантов текста, синтетических данных или черновых корпусов. Для таких систем стоит отдельно исследовать скрытое состояние на блок, параллельное восстановление фрагментов и декодер, обученный работать не только с точными представлениями кодировщика, но и с выходами генеративной модели.

BLD нельзя рассматривать как прямую замену обслуживаемой LLM. Эксперименты не показывают, как подход выполняет инструкции, отвечает на вопросы, вызывает инструменты или сохраняет факты в большом документе. Если продукт зависит от одиночных интерактивных запросов, сравнивать нужно задержку, а не пакетную пропускную способность.

Практический вывод уже можно использовать без перехода на BLD: состояние на каждый токен не обязательно для диффузионной генерации. Но сильное сжатие создаёт новый компромисс — модель тратит меньше вычислений на позиции и одновременно получает более трудную задачу по восстановлению структуры документа. Пока именно качество глобальной структуры ограничивает применение метода.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу