Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Предобученную авторегрессионную модель (AR) удалось превратить в диффузионную модель (dLLM), почти не потеряв её способность писать код и решать задачи. В нерецензированном препринте Celeris, где все числа получены авторами, вариант с замороженным контекстом набрал 71,60 на HumanEval против 6,19 у конвертации внутри исходной модели. При небольшом бюджете обучения это меняет выбор базовой архитектуры: отделять контекст от генерации оказалось полезнее, чем заставлять одни веса выполнять обе роли.
Почему обновление исходной модели портит длинные ответы
Авторегрессионная модель генерирует текст последовательно: каждый новый токен зависит от уже созданного префикса. Диффузионная модель получает блок с замаскированными позициями и восстанавливает их за несколько проходов, поэтому потенциально может работать над несколькими позициями параллельно.
Конвертация позволяет получить такую схему без полного предобучения новой LLM. Самый прямой вариант — обновлять часть весов исходной модели на задаче восстановления масок. В работе этот подход называется in-place: те же слои должны и представлять причинный контекст, и исправлять замаскированный блок.
На коротких ответах конфликт ролей почти не виден. Модель сохраняет значительную часть результата на тестах знаний, но теряет качество по мере роста ответа. Такой профиль повторился у нескольких рецептов: хуже всего пострадали код, математические рассуждения и структурированный вывод.
Frozen-tower разделяет роли. Замороженная копия исходной модели обрабатывает уже подтверждённый префикс, а обучаемый восстановитель читает её ключи и значения через перекрёстное внимание. Веса экспертов и представления токенов остаются общими, а само подключение не добавляет обучаемых параметров.
Теоретический разбор показывает, что обе архитектуры способны точно воспроизвести исходную модель, если открывать по одной позиции слева направо. Поэтому провал in-place нельзя объяснить недостаточной выразительностью схемы. Разница возникает при практическом обучении и параллельном восстановлении блоков.
Разрыв растёт там, где требуется генерация
Для основного сравнения обе модели получили один исходный Qwen со смесью экспертов, одинаковый корпус, идентичный порядок данных, общий оптимизатор, один миллиард обучающих токенов и единый набор тестов. HumanEval pass@10 оценивает вероятность, что хотя бы один из десяти вариантов кода пройдёт проверки.
Модель с замороженным контекстом сохранила 95% результата родителя на GSM8K и 99% на MMLU-Pro. In-place при этом продолжал отвечать на часть вопросов о знаниях, но резко уступал на длинной генерации. Значит, сохранённый тест знаний сам по себе не подтверждает, что после конвертации модель сможет писать рабочий код или выдерживать формат.
Авторы повторили сравнение с плотной исходной моделью и снова получили большой разрыв на HumanEval. Это снижает вероятность, что эффект связан только с маршрутизацией экспертов. Несколько вариантов in-place на меньшей модели показали тот же профиль: короткие ответы сохранялись лучше длинных.
Отдельный контроль точнее показывает роль заморозки. При бюджете около 500 миллионов токенов замороженная и обучаемая башни контекста дали неразличимый результат на HumanEval, но замороженная сохранила на 13 пунктов больше в MMLU-Pro. Следовательно, преимущество в генерации относится ко всей двухкомпонентной конфигурации, а заморозка отдельно помогает удержать знания.
Работа охватывает две исходные архитектуры и режим малого бюджета. Кроме заморозки, основные варианты различались функцией потерь, подготовкой масок и расписанием размера блока, поэтому весь разрыв нельзя приписать одному решению не обновлять контекст.
Когда стоит менять архитектурный план
Если команда хочет недорого конвертировать существующую LLM и продукт требует кода, длинных рассуждений или строгого формата, frozen-tower стоит рассматривать как базовый вариант. Результаты не поддерживают план, в котором качество длинной генерации предполагают восстановить одним лишь дообучением внимания внутри исходной модели.
За сохранение качества приходится платить вычислениями. Благодаря общим весам двухкомпонентная модель хранит исходную модель плюс 1,9 ГБ, но выполняет дополнительный проход замороженной башни. Работа сравнивает качество конвертации, а задержку и пропускную способность для конкретной инфраструктуры нужно измерять отдельно.
Она также не доказывает, что frozen-tower останется лучшим выбором при значительно большем бюджете. Высокобюджетные модели в статье обучались и декодировались по другим протоколам, а результат диффузионной LLM заметно менялся вместе со способом генерации.
Практический план проверки должен включать исходную AR-модель как контроль, одинаковые подсказки и ограничения длины, несколько запусков стохастического декодирования и отдельный замер детерминированного режима. Иначе изменение декодера можно принять за улучшение архитектуры. Для малого бюджета работа даёт более узкий вывод: стабильный причинный контекст снижает риск потерять уже выученные возможности при переходе к блочной генерации.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



