Журнал · Rit.work

HyperThink переносит рассуждение LLM из токенов в параметры

HyperThink подбирает небольшое обновление параметров под каждый запрос, чтобы LLM отвечала без длинной цепочки рассуждений и сохраняла качество при низкой задержке.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM смогла решать многошаговые задачи без длинной скрытой цепочки перед ответом. В HyperThink короткая генерация приблизилась к режиму без рассуждений по задержке и обошла обычную дистилляцию по качеству; поскольку это нерецензированный препринт, все числа получили сами авторы. Для продукта появляется промежуточный режим между быстрым прямым ответом и дорогим последовательным рассуждением.

Как вопрос превращается в обновление параметров

В обычном режиме рассуждения модель сначала последовательно генерирует длинный внутренний текст, а затем составляет видимый ответ. Каждый новый токен зависит от предыдущих, поэтому вычисления нельзя полностью распараллелить: чем длиннее цепочка, тем выше задержка.

HyperThink заменяет эту цепочку одним проходом дополнительной нейросети. Она читает вопрос и подбирает небольшое изменение параметров базовой LLM именно для этого запроса. После обновления модель сразу генерирует короткое пошаговое решение и итоговый ответ.

Меняются не все веса. HyperThink корректирует только параметры смещения в нескольких слоях трансформера — добавочные значения, которые сдвигают результат вычислений внутри слоя. В варианте для Qwen3-0.6B пространство обновления сократилось до 90 тысяч параметров, или 0,015% базовой модели.

Дополнительная сеть не может выбирать произвольное обновление. Декодер сопоставляет его с конечным набором выученных шаблонов с помощью векторного квантования: непрерывное представление заменяется ближайшим элементом из кодовой книги. Так похожие запросы повторно используют одни и те же способы настройки модели, а сеть реже подгоняется под обучающие примеры.

Для обучения берут ответы, которые базовая LLM сгенерировала в режиме длинного рассуждения, и оставляют правильные. HyperThink учится воспроизводить их без промежуточной цепочки, тогда как параметры самой LLM остаются замороженными. Длинное рассуждение тем самым переносится из каждого рабочего запроса в предварительное обучение дополнительной сети.

Выигрыш сосредоточен рядом с режимом прямого ответа

На MATH-500 средняя точность HyperThink составила 48,76% против 31,40% у дистилляции рассуждений с полным дообучением модели. Метрика Pass@5, которая считает задачу решённой, если правильным оказался хотя бы один из пяти ответов, выросла с 50,8% до 73,4%. При этом HyperThink потребовал на 37% больше вычислений, поэтому преимущество здесь состоит в лучшем соотношении качества и затрат, а не в бесплатном ускорении.

Дискретная кодовая книга оказалась существенной частью метода. Без неё обновления, зависящие от запроса, хуже переносились с обучающего GSM8K на MATH-500. Отдельные элементы кодовой книги группировали задачи по смыслу: одни чаще выбирались для алгебры и теории чисел, другие — для вероятностей или предварительного анализа.

На кривых «качество — задержка» метод лучше всего проявил себя рядом с режимом без рассуждений. Он не обошёл все варианты на каждом бюджете, но дал дополнительную точку выбора там, где прямой ответ слишком часто ошибается, а полноценная цепочка уже не укладывается в лимит времени.

Метод проверяли на Qwen3-0.6B, SmolLM3-3B и Olmo-3-7B-Think. Эксперименты охватили математические наборы GSM8K, DeepScaleR и MATH-500, а также задачи на программирование и ответы на вопросы. Это проверка на открытых моделях умеренного размера, а не подтверждение того, что тот же компромисс сохранится на любой архитектуре и масштабе.

Когда HyperThink меняет план продукта

Работа меняет план, если задержку сейчас сокращают только двумя способами: отключают рассуждение целиком или ограничивают число его токенов. HyperThink добавляет третий вариант — заранее обучить механизм, который подстраивает модель под конкретный запрос без последовательной генерации внутреннего текста.

Это не настройка подсказки и не замена модели через API. Для внедрения нужен доступ к внутренним параметрам LLM, отдельное обучение гиперсети и возможность применять новое обновление смещений для каждого запроса. Поэтому подход в первую очередь подходит командам, которые самостоятельно размещают модель и контролируют контур вывода.

Базовую LLM при этом не приходится полностью дообучать или хранить отдельную копию под каждый класс задач. Один замороженный экземпляр дополняется гиперсетью и кодовой книгой, а специализация возникает на время обработки запроса. Это может упростить эксперименты с несколькими режимами задержки: прямым ответом, HyperThink и полноценным рассуждением.

Закладывать метод в производственную архитектуру пока рано: в работе показан исследовательский прототип, а публикацию кода авторы только планируют. Практический следующий шаг — проверить на собственных запросах, окупает ли прирост качества дополнительный проход гиперсети и сохраняется ли результат за пределами математических и общих тестов статьи.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу