Журнал · Rit.work

Redline выбирает быстрый режим блочно-диффузионной модели с заданным риском

Redline сравнивает конфигурации блочно-диффузионной модели по регрессиям на отдельных запросах и выбирает самую быструю с заданной статистической гарантией.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появился способ выбирать самый быстрый режим блочно-диффузионной языковой модели, не полагаясь на среднюю точность. В препринте, который не рецензировали и где приведены числа самих авторов, математика ускорялась при меньшем допустимом риске, чем программирование. Для эксплуатации это превращает настройку порогов и точности вычислений из ручного выбора в проверяемую процедуру.

Как Redline измеряет риск отдельной конфигурации

Блочно-диффузионная модель генерирует текст блоками: блоки следуют друг за другом, но токены внутри каждого блока модель уточняет параллельно. Скорость зависит от порогов принятия токенов, числа обрабатываемых блоков, расписания, версии весов и точности вычислений.

Обычно конфигурации сравнивают по средней точности на наборе задач. Такая оценка скрывает регрессии: новый режим может ошибиться там, где эталон отвечал правильно, но компенсировать это верными ответами на других заданиях.

Redline считает именно такие случаи. Команда заранее выбирает эталонную конфигурацию, допустимую долю регрессий и набор кандидатов, затем запускает их на одних и тех же калибровочных запросах. Для каждого кандидата процедура отмечает запросы, где эталон верен, а кандидат ошибается.

Далее Redline применяет точный биномиальный критерий и поправку Holm, которая учитывает одновременную проверку нескольких конфигураций. Из прошедших проверку вариантов процедура выбирает тот, который фиксирует больше токенов за один прямой проход модели. Этот показатель не зависит от конкретной GPU и служит мерой вычислительной скорости.

Гарантия относится к запросам из того же распределения, что и калибровочная выборка. Она ограничивает вероятность регрессии относительно эталона без предположения о форме распределения данных, но не защищает от смены характера запросов после запуска.

Основной резерв скорости оказался в пороге принятия токенов

Замеры внутреннего цикла показали, что стандартное правило уже фиксирует каждый полностью готовый блок, который можно безопасно добавить в ответ. Более глубокие блоки часто простаивают, потому что ждут ещё не сгенерированный контекст. Простое правило, которое пропускает такие бесполезные вычисления, забирает почти весь доступный резерв этого уровня.

Самодистилляция на ответах, полученных тем же движком, добавила около 6% токенов за проход без ухудшения точности в проведённом сравнении. Более заметное ускорение потребовало снижать порог принятия и фиксировать ещё не вполне уверенные токены. Именно здесь появляется риск испортить ответ, который эталонная конфигурация решила бы правильно.

При бюджете такого риска 10% Redline выбрал для LLaDA2 на математических задачах режим с приростом токенов за проход на 37,5%. Средняя точность при этом снизилась на 4 процентных пункта: разница объясняется тем, что риск считает только новые ошибки относительно эталона, а средняя точность также учитывает новые правильные ответы.

Для задач по программированию ускорение потребовало более свободного бюджета: более быстрый режим впервые прошёл проверку при 11%. Результат показывает, почему один общий профиль для разных типов нагрузки может оказаться неудачным, даже если средняя точность выглядит сопоставимой.

Что меняется в планах команд

Redline не ускоряет модель сам по себе. Он позволяет безопаснее выбирать среди уже подготовленных режимов: порогов принятия, расписаний блоков, контрольных точек модели и форматов весов. Значит, сначала всё равно нужно сформировать сетку конфигураций и прогнать каждую на размеченной калибровочной выборке.

Для нового сервиса разумный план меняется так: вместо одного режима, выбранного по средней точности, команда сохраняет консервативный эталон, задаёт приемлемую долю регрессий и выбирает самый дешёвый вариант, который проходит статистическую проверку. Ту же процедуру авторы применили к спекулятивному декодированию и квантованию весов, поскольку ей нужны только итоговая правильность ответа и мера стоимости.

Работу проверяли на LLaDA2-mini и SDAR-8B, на математике и программировании, с жадным декодированием и калибровочными выборками от нескольких сотен до примерно тысячи запросов. Кандидатов сравнивали внутри одной модели, сборки движка и аппаратной среды; число токенов за проход там совпадало с порядком конфигураций по фактической пропускной способности.

Для продукта вывод практический: метод подходит, если ответы можно автоматически или стабильно размечать, а будущая нагрузка похожа на калибровочную. Он не заменяет нагрузочные испытания и не обещает ту же задержку на другом оборудовании, но отделяет допустимую потерю качества от случайного колебания средней точности.

Источники

Иллюстрация: рисунок из статьи «Faster Block-Diffusion Serving with Distribution-Free Risk Guarantees», Jungseob Lee, Dongyub Jude Lee, Chanjun Park и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу