Журнал · Rit.work

RAM-Net переносит веса Transformer в линейное внимание через мягкую квантизацию

RAM-Net связывает квантизацию KV-кэша с линейным вниманием и предлагает поэтапно переносить готовые веса Transformer в архитектуру с памятью фиксированного размера.

Rit.work
Студия разработки
9 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Готовый Transformer научились переносить в архитектуру с памятью фиксированного размера, не обучая замену с нуля. Работа The Chinese University of Hong Kong пока не рецензирована, а числа получили сами авторы: RAM-Net сохранил в среднем 87,1% преимущества исходных моделей над случайным угадыванием. Для команд это открывает промежуточный путь между сжатием KV-кэша и полной заменой механизма внимания.

Как RAM-Net связывает два способа экономить память

Обычный механизм внимания хранит ключи и значения всех предыдущих токенов в KV-кэше. При длинном контексте растут и память, и объём вычислений для следующего токена.

Квантизация уменьшает размер каждой записи: ключи и значения представляют дискретными кодами с меньшей точностью. Но число записей по-прежнему растёт вместе с контекстом. Линейное внимание поступает иначе: оно последовательно сворачивает историю в состояние фиксированного размера. Цена такой свёртки — разные фрагменты контекста могут мешать друг другу.

RAM-Net объединяет эти подходы. Архитектура задаёт конечный набор дискретных адресов, за каждым из которых стоит ячейка с непрерывным состоянием. Ключ определяет, в какие ячейки записать новое значение, а запрос — из каких ячеек читать. Назначение остаётся мягким: один ключ или запрос может использовать несколько адресов с разными весами.

При последовательной обработке RAM-Net обновляет только выбранные ячейки и умеет ослаблять старые записи. Поэтому ему не нужно хранить отдельную пару ключа и значения для каждого токена. Состояние имеет фиксированный размер, как у линейного внимания, но дискретные адреса сохраняют идею кодов из квантизации.

Теоретическая часть объясняет, почему такое чтение может заменить привычное сопоставление запросов и ключей. Пересечение мягких распределений по адресам локально приближает экспоненциальное скалярное сходство, на котором основан Transformer. Одновременно оно разделяется на независимые части для чтения и записи, поэтому историю можно накапливать последовательно.

Доказательство относится к специальной конструкции с фиксированным круговым кодовым словарём и проекциями низкого ранга. Практический RAM-Net использует более свободные проекции, поэтому теория объясняет направление миграции, но не полностью описывает работающую модель.

Как переносят готовые веса

Прямо заменить блок внимания рекуррентным блоком нельзя: совпадают размеры некоторых параметров, но меняется способ сопоставлять токены. Авторы вводят промежуточную модель с мягкой квантизацией, которая ещё воспроизводит распределение внимания исходного Transformer, но уже обращается к дискретным адресам.

Сначала проекции запросов и ключей сжимают адаптерами низкого ранга. Адаптеры настраивают так, чтобы сохранить карту внимания учителя — то есть веса, с которыми каждый токен обращается к предыдущим. Отдельно согласуют позиционное кодирование: для разных голов выбирают перенос вращательного кодирования либо вариант без него.

Затем круговой кодовый словарь встраивают в выровненные проекции. Экспоненциальное сравнение запросов и ключей заменяет пересечение распределений по адресам. Остальные совместимые параметры копируют из Transformer, поэтому промежуточная модель наследует не только общую структуру, но и значительную часть уже выученных преобразований.

После этого включают рекуррентные обновления RAM-Net и восстанавливают качество поэтапно: сначала на уровне отдельных голов, затем блоков внимания и всей модели. Проверка на Qwen показала, что полный поэтапный процесс работает лучше, чем настройка всей модели сразу при одинаковом бюджете. Удаление любого из промежуточных этапов также ухудшало итоговую точность.

Для внедрения это пока маршрут, а не готовая замена

Миграцию проверили на моделях размером от 0,3 до 7 млрд параметров из нескольких семейств Transformer. Каждой версии дали бюджет в 500 млн обучающих токенов и оценили её на шести задачах по здравому смыслу и знаниям. Итоговые 87,1% — не доля сохранённой абсолютной точности, а доля преимущества учителя над случайным угадыванием.

Результат показывает, что переход к состоянию фиксированного размера не обязательно начинает обучение заново. Это меняет план эксперимента для команды, у которой уже есть подходящий Transformer: вместо отдельного предобучения линейной модели можно перенести веса, выровнять внимание и компенсировать расхождения по этапам.

Однако качество переносится неравномерно. На LongBench, где проверяют работу с длинным контекстом, RAM-Net отставал от учителей сильнее, чем на задачах по знаниям; особенно заметным разрыв оказался у Mistral. Значит, фиксированная память сама по себе не гарантирует, что модель сохранит поиск и связывание информации на большой дистанции.

Работа измеряет качество миграции, но не фактическую задержку, пропускную способность и расход памяти при развёртывании. Поэтому она обосновывает прототип и даёт конкретный порядок переноса весов, но выбор архитектуры для продукта всё ещё требует собственных замеров на целевой длине контекста и оборудовании.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу