Журнал · Rit.work

Гибридный Transformer по головам: архитектура HwH для поиска и позиционной обработки

Авторы HwH предлагают распределять полное и линейное внимание между отдельными головами в зависимости от их роли, а не чередовать слои по фиксированной схеме.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Runlin Shi, Bojian Yin и Guoqi Li исследовали разделение функций между головами внимания в Transformer и на его основе собрали гибридную архитектуру HwH, причём работа опубликована как не прошедший рецензирование препринт. По замерам авторов, HwH лучше сравниваемых базовых архитектур переносит поиск на контекст длиннее использованного при обучении. Работа важна прежде всего командам, которые обучают собственные языковые модели и выбирают, как сочетать полное и линейное внимание.

Что сделали

Авторы начали с предположения, что головы внимания в моделях с RoPE — вращательным позиционным кодированием — уже образуют неявный гибрид. Одни головы отвечают за извлечение информации из удалённых частей контекста, другие используют положение токенов для локальной обработки последовательности. Обычные поведенческие проверки показали такие склонности, но не позволили однозначно классифицировать все головы.

Для более точного разделения авторы ввели две интервенционные метрики. Оценка значимости частот RoPE (RFIS) измеряет, насколько меняется полное распределение внимания головы, если убрать вклад одной частоты. Позиционная зависимость RoPE (RPD) заменяет вращение на этой частоте обычным скалярным произведением запросов и ключей. Так авторы отделяют важность самого канала от зависимости этого канала именно от позиции.

На моделях семейств Qwen3 и Llama3.1 авторы обнаружили средне-низкочастотную полосу, разделяющую два режима. Головы извлечения опирались преимущественно на частоты ниже неё и слабее зависели от позиции. Позиционные головы использовали саму полосу и более высокие частоты. Границу назвали Global Positional Band, или GPBand.

Затем эту гипотезу превратили в Head-wise Hybrid Architecture, сокращённо HwH. Внутри одного слоя головы полного внимания без RoPE, обозначенные NoPE FA, выполняют глобальное извлечение. Головы линейного внимания на основе Gated DeltaNet поддерживают локальное состояние и позиционную обработку. Доли этих компонентов меняются по глубине модели: глобальные головы сосредоточены в средней части, где анализ исходных Transformer чаще находил головы извлечения.

Что показали

В стандартной конфигурации на полное внимание приходится меньше, чем следует из соотношения 1:3 относительно линейного внимания. Это сокращает долю механизма с квадратичной сложностью по длине последовательности, но сохраняет прямой доступ к удалённым токенам у специально выделенных голов.

На наборе прикладных задач извлечения более крупная HwH получила средний результат 44,64 против 40,17 у обычного Transformer. Чистое линейное внимание оказалось слабее обоих вариантов, а гибрид с чередованием целых слоёв уступил распределению механизмов по головам.

На синтетической задаче NIAH-Single-2, где модель должна найти помещённый в длинный контекст фрагмент, HwH почти полностью сохранила точность при длине 4 тыс. токенов после обучения на последовательностях по 2 тыс. токенов. Обычный Transformer в приведённом сравнении не перенёс поиск за обучающую длину. У линейной модели поиск сохранялся преимущественно рядом с концом последовательности, а послойный гибрид сильнее зависел от положения искомого фрагмента.

Проверки с заменой компонентов поддержали предложенное авторами разделение ролей. Возврат RoPE в головы полного внимания ухудшал извлечение и перенос на длинный контекст. Изменение распределения глобальных голов между слоями также влияло на результат: удаление их из крайних слоёв и снижение доли вне середины модели улучшали перенос.

Ограничения

Архитектуру обучали с нуля только в масштабах 380 млн и 1,4 млрд параметров, используя от 15 до 100 млрд токенов FineWeb-Edu и контекст 2 тыс. токенов. Поэтому работа не показывает, сохранятся ли результаты у более крупных моделей, при другом составе данных, после дообучения под инструкции или в прикладных системах с существенно более длинным контекстом.

Основные сравнения охватывают обычный Transformer, чистый Gated DeltaNet и один послойный гибрид. В работе нет прямого сопоставления с широким набором существующих гибридных архитектур при одинаковом бюджете обучения. Также авторы не приводят замеры задержки генерации, пропускной способности, расхода памяти и фактической стоимости обучения. Меньшая доля полного внимания указывает на возможную экономию, но по представленным результатам её нельзя оценить для конкретного оборудования.

Классификацию голов проверяли на нескольких семействах с RoPE, однако это не доказывает, что те же две функции исчерпывают устройство моделей с другими позиционными механизмами, модальностями или схемами внимания. GPBand остаётся предложенной авторами интерпретацией наблюдаемой частотной границы.

Что это значит

Для команд, использующих готовые модели через API или разворачивающих существующие веса, работа планов не меняет: HwH — проект архитектуры для обучения с нуля, а не способ без переобучения заменить внимание в готовой модели. Она также не даёт достаточно эксплуатационных данных для выбора по стоимости или задержке.

Для разработчиков собственных базовых моделей вывод практичнее. Работа предлагает проверяемую альтернативу фиксированному чередованию слоёв: сначала определить, где модели требуется глобальное извлечение, затем назначить полное и линейное внимание отдельным головам с учётом глубины. Такой вариант стоит включать в архитектурные эксперименты, если главная задача — поиск за пределами обучающей длины при ограниченной доле полного внимания.

Однако менять утверждённый план обучения только по этим результатам рано. Рациональный следующий шаг — воспроизвести сравнение на собственных данных и проверить не только качество извлечения, но и скорость, память, устойчивость после дообучения и поведение на целевой длине контекста.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу