Журнал · Rit.work

Uno: заявка на ускорение LLM без черновой модели

Авторы Uno предлагают дополнить авторегрессионную LLM дискретной диффузией, чтобы параллельно генерировать токены без отдельной черновой модели.

Rit.work
Студия разработки
4 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Группа исследователей представила Uno — класс LLM для ускоренной генерации, описанный в препринте, который не проходил рецензирование. По замерам авторов, Uno генерирует текст быстрее базовой авторегрессионной модели при сохранении её распределения ответов. Работа важна командам, у которых скорость вывода LLM ограничивает стоимость или производительность продукта.

Что сделали

Обычная авторегрессионная LLM формирует ответ последовательно: предсказывает следующий токен, добавляет его в контекст и только после этого переходит к следующему. Такая зависимость затрудняет параллельную генерацию токенов и увеличивает время ответа.

Авторы предлагают сохранить авторегрессионную модель как основу, но дополнить её дискретной диффузией. В описанной схеме параметры разделены на две группы. Авторегрессионные веса обучаются стандартному предсказанию следующего токена, а дополнительные облегчённые диффузионные веса — одновременной генерации нескольких токенов.

Дополнительные веса получают через дистилляцию диффузии: новая часть модели учится воспроизводить поведение авторегрессионной основы. Авторы утверждают, что этот этап создаёт пренебрежимо малую нагрузку на существующий процесс обучения, однако численной оценки этой нагрузки в абстракте нет.

Для генерации предложено семейство алгоритмов выборки Ψ-Spec. По заявлению авторов, оно ускоряет вывод с сохранением распределения исходной авторегрессионной модели и позволяет увеличивать вычисления при фиксированной длине контекста. В отличие от спекулятивного декодирования, отдельная черновая модель не требуется: её роль выполняют диффузионные веса внутри Uno.

Uno можно обучать с нуля или получать добавлением диффузионной части к существующей авторегрессионной LLM с открытыми весами. Абстракт не раскрывает архитектуру этой части, порядок генерации и проверки токенов или требования к переобучению исходной модели, поэтому детальнее восстановить методику по доступному материалу нельзя.

Что показали

На проведённых авторами испытаниях Uno достигал до трёхкратного ускорения относительно базовой авторегрессионной модели. Преимущество сохранялось и при максимальном размере пакета запросов, который поддерживало использованное устройство. Абсолютная пропускная способность и характеристики устройства в абстракте не приведены.

Авторы также пишут, что Uno превосходил рассмотренные методы спекулятивного декодирования по пропускной способности при каждом проверенном размере пакета. Это сравнение особенно существенно для серверной эксплуатации: метод заявляет преимущество не только на одиночных запросах, но и при пакетной обработке.

Версия Uno с 8 млрд параметров, по замерам авторов, опередила открытую диффузионную модель DiffusionGemma с 26 млрд параметров и закрытую Mercury 2 на всех использованных испытаниях для работы с инструментами, программирования и рассуждений на длинном контексте. Названия испытаний, отдельные результаты и критерии оценки в абстракте не указаны.

Под «ускорением без потерь» в работе понимается сохранение качества и распределения базовой авторегрессионной модели. Это отличается от обычной диффузионной LLM, где ускорение может сопровождаться изменением поведения модели. Однако доступный абстракт не позволяет проверить, как именно авторы подтвердили эквивалентность результатов.

Ограничения

Материал подготовлен по абстракту, поскольку полный текст работы получить не удалось.

Из доступного описания нельзя восстановить методику измерений: не названы оборудование, форматы чисел, длины входа и ответа, размеры пакетов, число запусков и настройки генерации. Поэтому заявленное ускорение нельзя напрямую перенести на конкретную инфраструктуру или сопоставить с её текущей задержкой и стоимостью.

Абстракт не содержит названий наборов данных и испытаний, размеров проверочных выборок или результатов по отдельным задачам. В нём также нет численной оценки дополнительного обучения, потребления памяти и размера диффузионных весов. Это не позволяет оценить полную стоимость перехода на Uno.

Сравнение охватывает названные авторами методы спекулятивного декодирования, DiffusionGemma и Mercury 2, но условия их запуска не описаны. Неясно, использовались ли одинаковые устройства, ограничения контекста и режимы пакетной обработки. Работа также не показывает по доступному описанию поведение в прикладных сценариях с ограничением по первой задержке токена, строгим форматом ответа или многократными вызовами инструментов.

Что это значит

Работа пока не даёт оснований менять выбранную модель или переписывать контур вывода. Главный практический результат — направление для проверки: к существующей LLM с открытыми весами потенциально можно добавить параллельную генерацию, не разворачивая и не обслуживая отдельную черновую модель.

Для команд, которые только выбирают архитектуру, Uno добавляет ещё один вариант между обычным авторегрессионным выводом, спекулятивным декодированием и самостоятельной диффузионной LLM. Он выглядит наиболее уместно там, где качество базовой модели уже устраивает, а узким местом стала последовательная генерация.

План разработки стоит менять только после воспроизводимого испытания на собственной модели, оборудовании и профиле запросов. Проверять нужно не только число токенов в секунду, но и задержку полного ответа, использование памяти, устойчивость структурированного вывода и стоимость добавочного обучения. Пока таких данных для конкретной системы нет, Uno следует рассматривать как кандидат на технический прототип, а не как готовую замену действующего способа генерации.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу