Журнал · Rit.work

Вращаемые разреженные связи заменили большую часть attention в небольшой языковой модели

Фиксированная схема связей сократила время обучения языковой модели, но перенос на Qwen3-0.6B показал, что массово заменять attention пока рано.

Rit.work
Студия разработки
17 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Большую часть attention в небольшой языковой модели удалось заменить фиксированными разреженными связями без ухудшения качества. Гибрид на одной RTX 5070 обучался в 2,4 раза быстрее полной модели с attention; поскольку препринт не рецензирован, все числа получил сам автор. Результат даёт рабочую архитектуру для экспериментов с компактными моделями, но пока не обосновывает полную замену attention в готовых LLM.

Как поворот связывает всю последовательность

Yoshiaki Takashita из Waseda University представил позиции последовательности как вершины гиперкуба. На каждом слое позиция получает данные от самой себя и от одного соседа, причём следующий слой выбирает другое направление связи.

Вычисление состоит из сдвига и двух линейных преобразований. Слой не анализирует вход, не вычисляет сходство между позициями и не решает во время работы, откуда брать информацию. Поэтому число связей растёт линейно с длиной последовательности, тогда как полное attention сравнивает каждую позицию с каждой.

Сам по себе разреженный шаблон не помогает. Если все слои соединяют позиции в одном направлении, часть последовательности остаётся недоступной. При повороте слои последовательно проходят по всем направлениям гиперкуба, и информация получает путь между любыми позициями.

Это различие проверили на синтетической задаче: модель должна посчитать единицы во всей двоичной последовательности, а ответ разрешено читать только из начальной позиции. Вращаемая схема достигла точности 98,7%, а такой же по размеру фиксированный шаблон — 10,2%, то есть остался около уровня угадывания.

Порядок направлений почти не влиял на результат, пока сеть использовала каждое из них. Схема переставала работать, когда одно направление пропускали, даже если другие повторяли чаще. Значит, эффект связан не с конкретным расписанием, а с полным покрытием путей.

Где разреженная схема сравнялась с attention

Основной языковой опыт предсказывал следующий символ в enwik8. Потерю на отложенных данных измеряли в битах на символ: чем она ниже, тем увереннее модель назначает вероятность правильному продолжению.

Гибрид сохранил два слоя attention среди шестнадцати разреженных. При одинаковом бюджете шагов его потеря оказалась на 0,06 бита на символ ниже, чем у полной модели с attention. Разница между гибридом и полностью вращаемой схемой лежала в пределах разброса между запусками, поэтому их нельзя ранжировать по качеству.

Гибрид использовал примерно седьмую часть связей и на 42% меньше обучаемых параметров. Он также сохранял качество в более широком диапазоне скорости обучения, поэтому требовал менее точной настройки оптимизатора.

На втором корпусе из японского и английского текста с фрагментами кода порядок моделей сохранился: вращаемая и гибридная схемы опередили полное attention. Обучаемые координаты позиций преимущества не дали, хотя добавили вычисления и связи.

Маленькая версия модели показала другую картину. Гибрид сравнялся с attention, но полностью разреженные варианты отстали даже от плотного смешивания без поиска связей. Два оставленных слоя attention, вероятно, выполняли работу, которую узкая разреженная сеть не смогла освоить.

Планы стоит менять для новых моделей, но не для готовых LLM

Работа оправдывает прототип разреженной архитектуры, если команда обучает модель последовательностей с нуля и заранее знает максимальную длину входа. Сдвиги и линейные преобразования доступны в стандартных операторах ONNX, а при пошаговой генерации разреженному слою нужен ограниченный кэш, который не растёт вместе со всей историей.

Для существующих трансформеров вывод осторожнее. В Qwen3-0.6B почти без потери удалось заменить только два слоя attention из 28. При дальнейшей замене разрыв с контрольной моделью быстро рос: разреженные слои не превращали дополнительную обучаемую ёмкость в качество так же эффективно, как attention.

Языковые опыты охватывают два корпуса по 12 млн символов и модели размером до 40 млн параметров. Основные настройки повторяли с тремя начальными состояниями, но сравнивали при одинаковом числе шагов, пока кривые обучения ещё снижались. Проверка на Qwen использовала один размер модели, один корпус и один запуск для каждой точки.

Замер времени относится к обучению на одном не изолированном GPU, а не к обслуживанию запросов на целевом оборудовании. Поэтому экономию связей нельзя автоматически переводить в такую же экономию задержки или стоимости продукта.

Практический шаг — оставить несколько слоёв attention, заменить остальные вращаемыми связями и отдельно подобрать скорость обучения для обеих архитектур. Полный отказ от attention стоит рассматривать только после проверки на собственной задаче: работа показывает, что результат зависит от ширины модели и способа переноса уже обученных весов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу