Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM смогла решать многошаговые задачи без длинной скрытой цепочки перед ответом. В HyperThink короткая генерация приблизилась к режиму без рассуждений по задержке и обошла обычную дистилляцию по качеству; поскольку это нерецензированный препринт, все числа получили сами авторы. Для продукта появляется промежуточный режим между быстрым прямым ответом и дорогим последовательным рассуждением.
Как вопрос превращается в обновление параметров
В обычном режиме рассуждения модель сначала последовательно генерирует длинный внутренний текст, а затем составляет видимый ответ. Каждый новый токен зависит от предыдущих, поэтому вычисления нельзя полностью распараллелить: чем длиннее цепочка, тем выше задержка.
HyperThink заменяет эту цепочку одним проходом дополнительной нейросети. Она читает вопрос и подбирает небольшое изменение параметров базовой LLM именно для этого запроса. После обновления модель сразу генерирует короткое пошаговое решение и итоговый ответ.
Меняются не все веса. HyperThink корректирует только параметры смещения в нескольких слоях трансформера — добавочные значения, которые сдвигают результат вычислений внутри слоя. В варианте для Qwen3-0.6B пространство обновления сократилось до 90 тысяч параметров, или 0,015% базовой модели.
Дополнительная сеть не может выбирать произвольное обновление. Декодер сопоставляет его с конечным набором выученных шаблонов с помощью векторного квантования: непрерывное представление заменяется ближайшим элементом из кодовой книги. Так похожие запросы повторно используют одни и те же способы настройки модели, а сеть реже подгоняется под обучающие примеры.
Для обучения берут ответы, которые базовая LLM сгенерировала в режиме длинного рассуждения, и оставляют правильные. HyperThink учится воспроизводить их без промежуточной цепочки, тогда как параметры самой LLM остаются замороженными. Длинное рассуждение тем самым переносится из каждого рабочего запроса в предварительное обучение дополнительной сети.
Выигрыш сосредоточен рядом с режимом прямого ответа
На MATH-500 средняя точность HyperThink составила 48,76% против 31,40% у дистилляции рассуждений с полным дообучением модели. Метрика Pass@5, которая считает задачу решённой, если правильным оказался хотя бы один из пяти ответов, выросла с 50,8% до 73,4%. При этом HyperThink потребовал на 37% больше вычислений, поэтому преимущество здесь состоит в лучшем соотношении качества и затрат, а не в бесплатном ускорении.
Дискретная кодовая книга оказалась существенной частью метода. Без неё обновления, зависящие от запроса, хуже переносились с обучающего GSM8K на MATH-500. Отдельные элементы кодовой книги группировали задачи по смыслу: одни чаще выбирались для алгебры и теории чисел, другие — для вероятностей или предварительного анализа.
На кривых «качество — задержка» метод лучше всего проявил себя рядом с режимом без рассуждений. Он не обошёл все варианты на каждом бюджете, но дал дополнительную точку выбора там, где прямой ответ слишком часто ошибается, а полноценная цепочка уже не укладывается в лимит времени.
Метод проверяли на Qwen3-0.6B, SmolLM3-3B и Olmo-3-7B-Think. Эксперименты охватили математические наборы GSM8K, DeepScaleR и MATH-500, а также задачи на программирование и ответы на вопросы. Это проверка на открытых моделях умеренного размера, а не подтверждение того, что тот же компромисс сохранится на любой архитектуре и масштабе.
Когда HyperThink меняет план продукта
Работа меняет план, если задержку сейчас сокращают только двумя способами: отключают рассуждение целиком или ограничивают число его токенов. HyperThink добавляет третий вариант — заранее обучить механизм, который подстраивает модель под конкретный запрос без последовательной генерации внутреннего текста.
Это не настройка подсказки и не замена модели через API. Для внедрения нужен доступ к внутренним параметрам LLM, отдельное обучение гиперсети и возможность применять новое обновление смещений для каждого запроса. Поэтому подход в первую очередь подходит командам, которые самостоятельно размещают модель и контролируют контур вывода.
Базовую LLM при этом не приходится полностью дообучать или хранить отдельную копию под каждый класс задач. Один замороженный экземпляр дополняется гиперсетью и кодовой книгой, а специализация возникает на время обработки запроса. Это может упростить эксперименты с несколькими режимами задержки: прямым ответом, HyperThink и полноценным рассуждением.
Закладывать метод в производственную архитектуру пока рано: в работе показан исследовательский прототип, а публикацию кода авторы только планируют. Практический следующий шаг — проверить на собственных запросах, окупает ли прирост качества дополнительный проход гиперсети и сохраняется ли результат за пределами математических и общих тестов статьи.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



