Журнал · Rit.work

Zarya запускает одну языковую модель в двух режимах

Zarya совмещает авторегрессионное обучение с маскированной диффузией и позволяет выбирать способ генерации уже при запуске модели.

Rit.work
Студия разработки
18 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Zarya научилась генерировать текст последовательно или параллельными фрагментами без отдельных моделей для каждого способа. Leonid Sinev, Ilya Koziev и Vladislav Leshchuk описали семейство в препринте, который не прошёл рецензирование, а все числа в нём получили сами авторы. Один набор весов можно запускать как модель маскированной диффузии или со слотным спекулятивным декодированием.

Как слоты связывают два способа обучения

Zarya построена на Qwen3 и сохраняет причинное внимание: каждый токен видит только предшествующие позиции. Это позволяет использовать KV-кэш — сохранённые результаты внимания для уже обработанного текста — но не даёт маскированным позициям свободно учитывать будущие токены, как в полностью двунаправленных диффузионных моделях.

При обучении ответ делят на слоты, то есть последовательные группы токенов. Часть слотов остаётся видимой, а остальные заменяют специальной маской. На видимой части модель предсказывает следующий токен слева направо, а в скрытых слотах восстанавливает исходный текст по доступному контексту.

Обе ошибки входят в общую функцию потерь. Поэтому модель одновременно осваивает обычное авторегрессионное продолжение и восстановление сразу нескольких скрытых фрагментов. Перед вычислением видимые слоты переставляют в начало, а маскированные — в конец: при причинном внимании скрытая часть тогда видит весь открытый контекст.

Размер слотов постепенно увеличивают. Сначала модель работает с короткими фрагментами и получает задачу, близкую к предсказанию следующего токена; позднее ей приходится восстанавливать более крупные блоки. Такое расписание должно сгладить переход между двумя целями, хотя при увеличении слотов ошибка на кривой обучения скачкообразно растёт.

Веса дообучили на наборе инструкций объёмом около 37,7 млрд токенов с математикой, программированием и общими заданиями. Кроме слотного варианта, код поддерживает обучение на целых последовательностях, разные схемы маскирования и восстановление пропусков в начале, середине или конце текста.

Почему режим генерации можно выбрать после обучения

В первом режиме Zarya начинает с последовательности масок и раскрывает несколько позиций за проход. После каждого шага заполненные токены перемещаются перед оставшимися масками. Их представления больше не меняются, поэтому модель повторно использует KV-кэш вместо пересчёта всего контекста.

Это не классическая двунаправленная диффузия. Причинное внимание ограничивает связи между скрытыми позициями, зато делает вычисления совместимыми с инфраструктурой авторегрессионных моделей. Параметры температуры, ограничения вероятностной выборки и штрафа за повторы работают через тот же интерфейс генерации.

Во втором режиме текст делят на блоки и слоты. Диффузионный проход параллельно предлагает содержимое слотов, после чего модель оценивает уверенность по первому токену каждого фрагмента. Подходящие слоты проходят авторегрессионную проверку; сомнительные токены уточняются следующими проходами.

Принятые фрагменты сразу попадают в KV-кэш. Скорость и качество здесь зависят от порогов уверенности: слишком строгий порог уменьшит долю принятых слотов, а слишком мягкий может пропустить ошибки. В работе эти пороги задаются вручную, поэтому для нового домена их придётся подбирать вместе с размером слота.

Главное архитектурное решение — режим обучения не закрепляет способ запуска. Модель, обученную без слотов, разрешено запускать со слотным декодированием, и наоборот. Переключение относится именно к весам Zarya, которые обучались на смешанной цели, а не к произвольной исходной модели Qwen3.

Что результаты меняют в планах команд

Качество проверили только на младшей Zarya-0.6B и одном GPU A100. Набор испытаний включал GSM8K для математики, HellaSwag для выбора правдоподобного продолжения, IFEval для соблюдения инструкций и MBPP для генерации кода. Во всех случаях использовали слотный режим.

На GSM8K модель решила 26,5% задач по строгому совпадению ответа. На IFEval она выполнила 51,1% отдельных инструкций при строгой проверке, а на MBPP получила 15% по метрике pass@1, которая учитывает решение с первой попытки. Эти результаты показывают, что схема генерирует связные ответы, но не устанавливают преимущество над исходным Qwen3 или другими гибридными моделями.

Для исследовательской команды работа меняет устройство эксперимента. Больше не нужно заранее связывать конкретную схему маскирования с единственным способом генерации: одни веса можно прогнать в двух режимах и отдельно подобрать число проходов, размеры слотов и пороги принятия.

Для продуктовой команды оснований менять модельный стек пока меньше. В оценке измеряли качество, но не приводили собственного сравнения скорости двух режимов. Без замеров задержки, пропускной способности и расхода памяти на целевом оборудовании нельзя определить, окупает ли параллельное заполнение дополнительные проходы и проверку слотов.

Практический результат Zarya — не доказанное ускорение, а совместимая с KV-кэшем площадка для проверки гибридной генерации. Она подходит для прототипа, где команде нужно сравнить последовательный и слотный запуск при одинаковых весах, но решение о промышленном внедрении потребует собственных нагрузочных тестов.

Источники

Иллюстрация: рисунок из статьи «Zarya: A Hybrid Autoregressive--Masked Diffusion Language Model with Flexible Training and Dual-Mode Inference», Leonid Sinev, Ilya Koziev, Vladislav Leshchuk, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу