Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Lintai Hou представил Graph Machine — архитектуру для предобучения языковых моделей, — в препринте, который не проходил рецензирования. В лучшей конфигурации автор измерил немного меньшую функцию потерь, чем у плотной базовой модели. Работа важна командам, которые обучают собственные LLM и упираются в стоимость внимания на длинных последовательностях.
Что сделали
За основу автор взял Qwen3-0.6B и заменил 75% плотных слоёв трансформера слоями Graph Machine. Получившиеся гибридные модели обучались с нуля на 15,7 млрд токенов из FineWeb-Edu при одинаковых настройках базовой архитектуры и обучения.
Обычный трансформер хранит ключи и значения для всей последовательности и на каждом шаге сопоставляет новый токен со всеми доступными предыдущими позициями. Поэтому объём вычислений внимания растёт квадратично с длиной последовательности. Разреженное внимание сокращает число обращений, но часто выбирает позиции по заранее заданной схеме — например, из локального окна.
Graph Machine тоже хранит состояние для всей последовательности, однако обращается только к постоянному числу его элементов. Для этого рядом с признаками токенов модель передаёт между слоями рёбра: индексы позиций, похожие на указатели, и их вещественные веса. Индекс определяет, откуда читать ключ и значение, а вес показывает, насколько этому адресу следует доверять.
Рёбра обновляются механизмом перенаправления. Сосед токена может указать на своего соседа, после чего модель объединяет такие пути, оставляет наиболее весомые адреса и передаёт их следующему слою. Индексы дискретны и сами по себе не получают градиенты, поэтому обучение идёт через мягкие веса рёбер. Жёсткий отбор сохраняет разреженность, но градиенты получают только оставленные варианты.
В разреженном внимании адреса задают небольшой набор ключей и значений. Обычная оценка соответствия запроса и ключа объединяется с весом ребра: итог зависит одновременно от содержания позиции и от уверенности маршрутизатора. Между такими слоями остаются плотные слои, адреса из которых можно использовать для обновления разреженного графа.
Что показали
В каждой разреженной голове ключей и значений модель извлекала только 2 или 4 позиции из последовательности длиной 4096 токенов. Автор сравнивал модели по функции потерь на фиксированной отложенной части FineWeb-Edu: эта метрика показывает среднюю ошибку предсказания следующего токена, но не качество выполнения прикладных задач.
Лучшая конфигурация Theia, использующая более узкий доступ, получила итоговую функцию потерь на 0,014 выше плотной базовой модели. Лучшая Hyperion с более широким доступом оказалась на 0,003 ниже неё. Работа не приводит оценки статистической значимости этой небольшой разницы, поэтому результат Hyperion следует трактовать как паритет по выбранной метрике, а не как подтверждённое превосходство.
По наблюдениям автора, перенаправление рёбер помогало по сравнению с вариантом без него, однако добавление новых шагов улучшало результат не во всех конфигурациях. Это указывает, что полезен сам механизм изменения адресов, но его глубину ещё нельзя выбирать по универсальному правилу.
Ограничения
Эксперимент охватывает небольшой по меркам предобучения масштаб, один корпус, фиксированную длину последовательности и один случайный seed. Проверялась только функция потерь предобучения: в работе нет замеров на диалогах, программировании, поиске информации в длинном контексте и других последующих задачах. Не исследованы модели другого размера и перенос результата на более длительное обучение.
Сравнение вычислительной сложности основано на оценке числа операций, причём из неё исключены нормализация, активации, разреживание и другие части исполнения. Прототип Graph Machine на использованном GPU обучался примерно втрое дольше плотной базовой модели. Автор связывает разрыв с реализацией на общем PyTorch и нехваткой специализированных ядер, но работа не показывает, насколько оптимизация устранит его. Также нет полноценного сравнения скорости генерации, пиковой памяти и стоимости эксплуатации.
Что это значит
Для продуктовых команд, использующих готовые модели через API или разворачивающих доступные веса, работа планы не меняет: Graph Machine пока не представлен как совместимая замена существующей LLM и не имеет подтверждённых преимуществ на прикладных сценариях.
Для команд, обучающих собственную базовую модель, это направление заслуживает отдельного прототипа. По расчётам автора, Graph Machine сокращал оценочный объём вычислений обучения на 5–15% относительно плотной основы при близкой функции потерь. Архитектура предлагает иной компромисс: вместо сравнения со всей историей модель переносит между слоями адреса нужных позиций и выполняет прямое чтение по ним.
Однако расчёт операций пока не превращается в сокращение времени или стоимости обучения. Практический план разумно менять только после проверки специализированных ядер, пропускной способности памяти и качества на целевых задачах. Сейчас работа обосновывает исследовательскую гипотезу: большую часть плотного внимания можно заменить динамическими указателями. Она ещё не обосновывает переход производственной модели на новую архитектуру.
Источники
Иллюстрация: рисунок из статьи «Graph Machine: Towards Better Pretraining via Edges», Lintai Hou, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



