Журнал · Rit.work

CRISP: разреженное внимание без накопления шума в длинном префилле

Авторы CRISP предложили выбирать блоки внимания по уровню фонового шума и измерили ускорение длинного префилла при сохранении качества моделей.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из University of Oregon, Adobe Research и Hanoi University of Science and Technology представили CRISP — способ ускорить обработку длинного контекста в LLM; работа опубликована как препринт, не прошедший рецензирование. По замерам авторов, вычисление внимания ускорилось до 5,30 раза относительно FlashAttention при контексте 512 тыс. токенов. Результат важен командам, у которых предварительная обработка длинного запроса, или префилл, стала заметной частью задержки и стоимости вывода модели.

Что сделали

Префилл — этап, на котором модель обрабатывает весь входной контекст перед генерацией первого токена. Обычное самовнимание сопоставляет позиции контекста попарно, поэтому объём вычислений растёт квадратично с его длиной. Разреженное внимание сокращает работу: модель вычисляет внимание только для выбранных токенов или блоков.

CRISP развивает динамический подход FlexPrefill. В нём каждая голова внимания направляется по одному из двух путей. Vertical-Slash подходит головам, у которых внимание сосредоточено около начальных токенов, недавнего контекста, вертикальных столбцов и диагоналей. Pooled-Estimation предназначен для более равномерно распределённого внимания.

FlexPrefill выбирает путь через дивергенцию Jensen–Shannon: строит дополнительную агрегированную карту внимания и сравнивает её с картой по отдельным запросам. Для этого нужны отдельное матричное умножение, функция softmax и последующие вычисления дивергенции. CRISP заменяет эту процедуру показателем C_struct: он измеряет, какая доля уже рассчитанной приближённой карты приходится на начальные позиции и локальное окно. Дополнительную агрегированную карту строить не требуется.

Второе изменение касается выбора блоков. Кумулятивный порог набирает блоки, пока они вместе не покроют заданную долю внимания. Авторы описывают два сбоя такого правила. Если начальные токены поглощают большую часть веса, отбор заканчивается до содержательно важных участков. Если оставшегося веса недостаточно, алгоритм пересекает границу между сигналом и шумом и добавляет всё больше фоновых блоков по мере роста контекста.

CRISP оценивает средний уровень фоновой массы после исключения начального и последнего блоков, которые сохраняются всегда. На пути Vertical-Slash выбираются блоки выше этого уровня, поэтому вычислительный бюджет зависит от структуры конкретного входа, а не от фиксированной доли покрытия. Для распределённых голов на пути Pooled-Estimation прежний кумулятивный отбор сохраняется. Метод не требует обучения и рассчитывает обычное softmax-внимание внутри выбранных блоков.

Что показали

Авторы проверили CRISP на Llama-3.1-8B-Instruct и Qwen2.5-7B-Instruct с наборами InfiniteBench, RULER и LongBench. В сравнение вошли точное плотное внимание через FlashAttention, MInference и две конфигурации FlexPrefill. Задержку измеряли только для операции внимания на одном NVIDIA H100 с 80 ГБ памяти, а не для полного цикла вывода модели.

C_struct повторил решения маршрутизатора FlexPrefill для 94,0% измеренных голов Llama и 88,1% голов Qwen. Это подтверждает заявленную авторами связь между массой на структурных позициях и выбором пути, но не полную эквивалентность двух маршрутизаторов.

В агрегированных результатах CRISP соответствовал точному вниманию или превосходил его на задачах с интенсивным поиском информации в контексте. Максимальный выигрыш относительно разреженных базовых методов составил 28 процентных пунктов на отдельных задачах поиска. При этом результаты различались между моделями и типами заданий: преимущество на поиске не означает такого же эффекта на агрегации или многошаговой обработке контекста.

Ограничения

Проверка охватывает два семейства моделей масштаба 7–8 млрд параметров. C_struct опирается на наблюдаемое у них устройство внимания: концентрированные головы размещают значительную массу на начальных и недавних токенах. Авторы прямо указывают, что для архитектур без выраженных «поглотителей внимания» эта связь не гарантирована и потребуется другой структурный показатель.

CRISP наследует бинарное разделение голов из FlexPrefill, хотя реальные головы могут совмещать концентрированный и распределённый рисунок. В таком случае путь Vertical-Slash способен отбросить полезные токены, не соответствующие ожидаемой структуре. Основные изменения также сосредоточены именно на этом пути, тогда как Pooled-Estimation остаётся менее проработанным.

Работа не показывает поведение на более крупных моделях, при декодировании по одному токену и на оборудовании, отличном от использованного GPU. Сравнение задержки ограничено самим вниманием, поэтому из него нельзя вывести ускорение всей системы: подготовка данных, обмен между GPU, остальные слои модели и генерация в замер не входят. Независимого воспроизведения результатов в представленных материалах также нет.

Что это значит

Работа не требует пересматривать архитектуру продукта, но добавляет практичного кандидата в набор оптимизаций для длинного контекста. CRISP имеет смысл оценивать, если система использует модели со сходной структурой внимания, обслуживает длинные документы или большие истории диалога и упирается именно в префилл. Возможность применить метод без дополнительного обучения снижает объём эксперимента по сравнению с заменой модели или её дообучением.

Менять планы на основании приведённого ускорения рано. Команде потребуется сравнить CRISP с текущим плотным и разреженным вниманием на собственных распределениях длины, задачах и оборудовании, отдельно проверив качество поиска и агрегации. Решение о внедрении должно опираться на полную задержку до первого токена и производительность сервиса, поскольку опубликованный выигрыш относится к одной вычислительной операции.

Для систем, где основная стоимость приходится на декодирование, сетевой обмен или другие слои модели, работа планов не меняет. Для проектов, уже ограниченных длинным префиллом на Llama- или Qwen-подобной архитектуре, она обосновывает отдельный технический прототип, но не замену производственного контура без собственных замеров.

Источники

Иллюстрация: рисунок из статьи «CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing», Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу