Журнал · Rit.work

A2D переносит навыки AR-моделей в диффузионные LLM без обучения

Метод A2D переносит результаты дообучения авторегрессионных моделей в родственные диффузионные LLM без нового обучения и дополнительных вычислений при ответе.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Навыки уже дообученной авторегрессионной модели можно перенести в родственную диффузионную LLM без нового обучения. В нерецензированном препринте EPFL все числа получили сами авторы; их метод A2D улучшал следование инструкциям, решение математических задач и генерацию кода по сравнению с исходными диффузионными моделями, не добавляя вычислений при ответе. Существующие контрольные точки AR-моделей можно использовать вместо отдельного цикла дообучения диффузионной версии.

Авторегрессионная модель (AR) генерирует текст слева направо, а диффузионная несколько раз уточняет сразу части последовательности. Многие диффузионные LLM получают из предварительно обученных AR-моделей, однако после преобразования их обычно дообучают отдельно под инструкции, математику или код.

A2D вычисляет разницу между весами базовой и дообученной AR-модели — в работе её называют вектором задачи — и прибавляет её к весам диффузионной модели с тем же происхождением. Если диффузионная версия уже прошла собственное дообучение, метод смешивает два набора обновлений. Обе операции выполняют один раз при подготовке контрольной точки: число параметров и схема генерации не меняются.

Обновления AR- и диффузионной моделей оказались почти перпендикулярны в пространстве весов: косинусное сходство составило 0,016 для кода и 0,009 для математики. При этом внутри диффузионной модели они сходным образом меняли представления и исправляли разные ответы. Поэтому промежуточная смесь весов могла сохранить удачные решения обеих версий и превзойти каждую из них отдельно.

В контролируемых опытах пары моделей дообучали на одинаковых наборах из 100 000 примеров по математике или программированию. Затем A2D проверяли на шести семействах, включая Dream, DiffuCoder, Nemotron-Labs-Diffusion и DiffusionGemma, с обновлениями после обучения с учителем и с подкреплением. Эксперименты охватывают совместимые пары, которые происходят от одной базовой модели: результат нельзя напрямую переносить на произвольные контрольные точки с другой архитектурой.

Источники

Иллюстрация: рисунок из статьи «Enhancing Diffusion Language Models with Autoregressive Post-Training Weights», Yiming Qin, Ke Wang, Amel Abdelraheem и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу