Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Предварительную обработку длинного запроса к LLM ускорили без переобучения модели. В препринте Rutgers University, OceanBase и Ant Group, который не рецензирован и приводит замеры самих авторов, время до первого токена на контексте 128 тыс. токенов сократилось в 5,97 раза. Для сервисов с длинными документами это уменьшает задержку перед началом ответа, а размен между скоростью и качеством задают пороги отбора.
Предварительная обработка — этап, на котором модель читает весь запрос до генерации. Разреженное внимание ускоряет его, разбивая ключи на блоки и отбрасывая малополезные, но среднее значение блока может скрыть один важный токен среди нерелевантных. Пятая самых неоднородных блоков содержала 39,5% блоков из верхних 5% по весу внимания — почти вдвое больше равномерной доли.
RBS-Attention ведёт отбор по двум веткам. Первая оценивает среднюю релевантность блока через его центр, вторая учитывает радиус — максимальное расстояние отдельного ключа от центра. Вес второй ветки зависит от распределения радиусов в текущем запросе, слое и головке внимания; затем метод объединяет результаты и вычисляет внимание только для сохранённых блоков.
На H100 сам механизм внимания ускорился в 20,65 раза. На RULER плотная Qwen3-32B набрала 89,52 балла, а RBS-Attention — 88,65: разрыв меньше одного пункта. Более жёсткий отбор оставляет меньше блоков и ускоряет обработку, но повышает риск потерять нужный фрагмент.
Скорость проверяли на Qwen3-30B-A3B-Instruct-2507-FP8, качество — также на плотной и мультимодальной Qwen в RULER, LongBench-v2, InfiniteBench и Video-MME. Сравнение охватывает плотное внимание и другие способы разреженного отбора; основные системные замеры сделаны на H100, дополнительные — на A100. Метод нацелен именно на чтение длинного запроса: для короткого контекста расходы на отбор окупаются хуже, а ускорение генерации после первого токена работа не устанавливает.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



