Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Контекстную память трансформера научились хранить в обычной оперативной памяти и читать без перебора всей истории при каждом новом токене. В препринте Moritz Brösamle из University of Tübingen, который не проходил рецензирование и содержит замеры самого автора, LEMA сохраняет постоянное время генерации при росте состояния и работает по скорости близко к GDN. Для архитектурных планов это создаёт третий вариант между полным кэшем ключей и значений softmax в памяти GPU и моделями с памятью фиксированного размера, но пока с потерей качества относительно softmax.
Точное совпадение превращает механизм внимания в словарь
Обычный softmax-трансформер сравнивает запрос со всеми сохранёнными ключами и смешивает значения с учётом их похожести. Поэтому при генерации нового токена он читает весь накопленный кэш: чем длиннее контекст, тем больше вычислений и памяти GPU требуется.
LEMA сначала превращает запросы и ключи в двоичные последовательности. Затем запрос получает значение только от последнего ключа, который совпал с ним полностью. Если совпадения нет, механизм возвращает ноль.
Такой кэш можно реализовать обычным словарём: для каждого токена выполняются один поиск и одна запись. Повторный ключ перезаписывает прежнее значение, поэтому размер состояния зависит не напрямую от длины контекста, а от числа разных ключей.
Именно полное совпадение отличает LEMA от прежних вариантов жёсткого механизма внимания. Они обычно ищут ключ с максимальной близостью, а такой поиск нельзя свести к столь же простому точному обращению по адресу. В LEMA ключ уже служит адресом, поэтому словарь можно разместить в основной оперативной памяти, оставив в памяти GPU параметры модели и текущие активации.
Работа связывает эту конструкцию с word-RAM — абстракцией компьютера с произвольным доступом к памяти. LEMA-трансформер с промежуточными токенами рассуждения может имитировать такую машину, а word-RAM может выполнять LEMA с затратами на токен, которые зависят от размера модели, но не от длины контекста. Память при этом растёт вместе с числом уникальных ключей.
Обучение пока не догнало softmax
Точное сравнение двоичных ключей не даёт обычного градиента, поэтому напрямую обучать LEMA нельзя. Для двоичного преобразования используется приближённый градиент, а точный поиск во время обучения заменяет гладкий механизм внимания. По ходу обучения его постепенно ужесточают, пока поведение не приблизится к точному совпадению.
Это решает проблему градиента, но не снижает стоимость обучения: она остаётся квадратичной по длине последовательности. Выигрыш относится к авторегрессионному инференсу после обучения, а не ко всему жизненному циклу модели.
Языковые модели LEMA обучили на FineWeb-Edu, доведя размер до 834 млн параметров. По функции потерь они соответствовали softmax-трансформерам примерно вдвое меньшего размера. Иными словами, постоянная скорость обращения к памяти пока оплачивается дополнительными параметрами.
На повторяющихся редких фразах и поиске вставленного фрагмента LEMA уступила softmax, но удерживала информацию на больших расстояниях, чем сопоставимая GDN — модель с линейным механизмом внимания и состоянием фиксированного размера. В синтетической задаче на запоминание ассоциаций растущее состояние LEMA также позволяло хранить больше пар, тогда как GDN упиралась в размер своего состояния.
Проверки охватывают синтетическое ассоциативное запоминание, языковое моделирование, повтор редких фраз и задачи поиска фрагмента в контексте. Основные языковые замеры проводили при контексте 2 048 токенов, а дальнее воспроизведение и реализацию инференса проверяли вплоть до 16 384 токенов. Это первый тест масштабирования новой архитектуры, а не сравнение с крупными производственными LLM.
LEMA стоит проверять как отдельную архитектуру, а не замену кэша
Работа меняет планы команд, для которых длину контекста ограничивает память GPU. LEMA показывает технически связную схему: состояние может расти, находиться в основной памяти и при этом не требовать полного прохода по сохранённым ключам для каждого токена. Реализация на хеш-таблицах сохраняла постоянную скорость генерации, близкую к GDN, пока таблица не приближалась к заполнению.
Однако LEMA нельзя подключить как новый способ хранения кэша уже обученного softmax-трансформера. Она меняет сам механизм внимания, требует двоичных ключей, специального обучения и отдельной реализации инференса. Архитектуру придётся обучать заново.
Для продукта, где важнее качество на текущем контексте, результаты пока не дают основания уходить от softmax: LEMA требует более крупной модели и хуже извлекает сведения на расстоянии. Для систем, где нужно помнить растущий набор точных ассоциаций, а память GPU стала главным ограничением, LEMA оправдывает экспериментальную ветку рядом с softmax и моделями фиксированного состояния.
Главный инженерный обмен здесь стал явным: softmax хранит подробный контекст, но платит памятью GPU и растущим временем чтения; GDN держит постоянное состояние, но теряет сведения при переполнении; LEMA разрешает состоянию расти в оперативной памяти, однако извлекает данные только через выученные точные адреса. Пока это вариант для прототипа архитектуры, а не готовый выбор по умолчанию.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



