Журнал · Rit.work

LLM ускорили выдачу JSON без таблиц токенов

Движок stcon пересчитывает допустимые токены на GPU, пропускает предопределённый схемой текст и сокращает расход памяти на грамматики.

Rit.work
Студия разработки
8 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научились быстрее выдавать JSON по схеме и вызовы инструментов, не меняя выбранные моделью ответы. В препринте MBZUAI, который не прошёл рецензирование и приводит замеры самого автора, структурированная выдача ускорилась в 1,18–1,28 раза. Такой подход позволяет держать больше схем на одном сервере и сокращать задержку агентов без замены модели.

Обычный движок компилирует схему в детерминированный автомат и на каждом шаге строит маску, то есть набор допустимых токенов. Если зафиксировать состояние автомата и токен, его байты можно пройти только одним маршрутом. Поэтому stcon не хранит таблицу переходов для каждой пары из состояния и токена, а пересчитывает нужную строку на GPU.

Эта особенность связывает практическую задачу с графами, где между точками проходит мало маршрутов. Конструкции из теоретического доказательства превратились в несколько приёмов: обязательный по схеме текст движок добавляет без отдельного запуска модели, рекурсивные форматы обрабатывает небольшим стеком, а независимые поля генерирует параллельно и затем проверяет. Лимит токенов учитывается заранее, чтобы ответ не оборвался внутри значения.

Грамматика занимает около 3 МБ вместо таблицы размером до 1,5 ГБ. Пакет из шестнадцати агентов, которые вызывали инструменты, завершил работу в 2,55 раза быстрее базовой связки MLX и llguidance.

Проверка охватывает одну машину Apple M2 Pro с 16 ГБ общей памяти, модели Qwen3.5-2B и Qwen3.5-4B, JSON-схемы, рекурсивные структуры и агентские задачи. Везде использовали четырёхбитные веса и жадное декодирование, поэтому результаты пока описывают локальный запуск на Apple hardware, а не серверные GPU и другие семейства моделей.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу