Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Для блочно-разреженного внимания предложили способ выбирать нужные участки длинного контекста без полного квадратичного перебора. В препринте, который не прошёл рецензирование и приводит результаты самих авторов, механизм PISA меняет вычислительную сложность выбора с O(N²) на O(N log N). Для продуктовой команды это пока не готовая замена обычному вниманию, а основание проверить длинный контекст на собственных нагрузках.
Пирамида заменяет полный перебор блоков
Обычное самовнимание сопоставляет каждый элемент последовательности со всеми остальными. Число таких сопоставлений растёт квадратично: если контекст увеличивается, вычисления и память становятся главным ограничением.
Блочно-разреженное внимание сокращает работу: оно делит последовательность на блоки и оставляет только часть связей между ними. Но сначала нужно определить, какие блоки сохранить. Если оценивать каждую возможную пару запроса и блока, этап отбора снова получает квадратичную сложность и съедает часть выгоды.
PISA ищет подходящие блоки сверху вниз. Метод объединяет ключи — векторы, с которыми сравнивают текущий элемент последовательности, — и строит из них иерархию от грубого представления к подробному. Число уровней растёт как O(log N), где N обозначает длину последовательности.
Поиск начинается на самом грубом уровне. На каждом следующем уровне PISA рассматривает только ограниченный набор кандидатов, оценивает их через LogSumExp — логарифм суммы экспонент — и передаёт лучшие варианты дальше. До исходного разрешения доходят уже не все блоки, а ветви, которые сохранила предыдущая ступень.
Так пирамида переносит основную экономию именно в маршрутизацию внимания. Это отличает PISA от разреженной схемы, которая ускоряет итоговое вычисление внимания, но перед ним всё равно строит оценки для всех пар.
Triton-ядра не создают полную матрицу оценок
Авторы реализовали отдельные ядра Triton для обучения и вывода модели. Они объединяют иерархическую маршрутизацию и вычисление LogSumExp в одной аппаратно-ориентированной реализации.
Ключевая практическая деталь — ядра не создают в памяти полную матрицу оценок «запрос — ключ». Без этого одной асимптотики было бы недостаточно: промежуточная матрица могла бы сохранить прежние требования к памяти, даже если последующие операции работали только с выбранными блоками.
Сложность всего отбора составляет O(N log N). Однако это ещё не означает такое же ускорение приложения: реальное время зависит от длины контекста, размера блоков, доли сохранённых связей, оборудования и доли внимания в полном цикле обработки запроса.
Качество проверяли на задачах языкового моделирования. Относительно базового варианта PISA показала сопоставимые результаты в тестах на рассуждения о здравом смысле и лучшие — в задачах поиска сведений в контексте.
Проверка охватывает только перечисленные в абстракте типы задач; поскольку материал подготовлен по абстракту, а не по полному тексту, из доступного описания нельзя восстановить наборы данных, масштабы контекста, точную схему сравнения и величину выигрыша.
Планы стоит менять на уровне прототипа, а не архитектуры
PISA имеет прямое отношение к продуктам, где длинный контекст уже ограничивает стоимость или задержку: обработке крупных документов, поиску по истории диалога и работе с большими наборами кода. Метод атакует не только вычисление разреженного внимания, но и скрытый квадратичный этап выбора блоков.
Пересматривать архитектуру готового продукта по этому результату рано. В доступных материалах нет измерений задержки, расхода памяти или пропускной способности, поэтому сравнить PISA с используемым стеком на конкретной GPU нельзя. Сопоставимое качество на одном классе задач также не гарантирует, что модель сохранит важные зависимости в прикладном контексте.
Практический следующий шаг — отдельный прототип на характерных длинах последовательности. В нём стоит измерить полное время обучения и вывода, пиковую память и качество ответов на примерах, где нужный фрагмент находится далеко от запроса.
Особенно важно сравнивать не только механизм внимания, но и модель целиком. Если время уходит на генерацию токенов, загрузку весов или другие слои, ускоренный выбор блоков мало изменит задержку сервиса. Если же профиль показывает, что маршрутизация разреженного внимания стала узким местом, PISA даёт понятную схему для эксперимента и готовое направление реализации через Triton.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



