Журнал · Rit.work

State of Thought управляет рассуждением через внутреннее состояние модели

State of Thought выбирает нужные шаги из истории по внутреннему состоянию модели: в тестах метод сократил число токенов на 62,6% и задержку на 44,6%.

Rit.work
Студия разработки
16 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковую модель научили самой решать, какие прежние шаги рассуждения ей нужны дальше и когда пора остановиться. В препринте команды Nanyang Technological University, который не прошёл рецензирование и содержит замеры самих авторов, State of Thought сократил число сгенерированных токенов на 62,6%, а сквозную задержку — на 44,6%, одновременно повысив точность. Для команд с доступом к весам модели это альтернатива длинным подсказкам, повторным попыткам и поиску по нескольким веткам.

Как внутреннее состояние управляет ходом рассуждения

Обычная цепочка рассуждений задаёт модели форму снаружи: сначала разбить задачу на шаги, затем проверить ответ или построить несколько вариантов. Поиск расширяет этот подход и тратит дополнительные вычисления на ветки, среди которых затем выбирает результат. В обоих случаях программа вокруг модели определяет, как долго рассуждать и какую историю передать на следующий шаг.

State of Thought, или SoT, переносит это решение внутрь контура вывода. После каждого смыслового шага система считывает четыре сигнала из скрытых представлений модели: насколько локально сосредоточена информация, как меняется состояние, сохраняется ли направление рассуждения и насколько модель не уверена в продолжении.

Эти сигналы поступают в контроллер на 582 параметра. Он выбирает из истории только те фрагменты, которые пригодятся для следующего решения, и отдельно определяет, продолжать ли рассуждение. Исходная LLM остаётся замороженной: SoT не меняет её веса и не создаёт вторую модель сопоставимого размера.

Контроллер обучают заранее на многошаговых траекториях. Для каждого состояния ему показывают, какие предыдущие фрагменты помогли продолжить решение и в какой момент уже можно было перейти к ответу. Поэтому экономия возникает не из жёсткого ограничения длины: модель переносит вперёд меньше нерелевантного контекста и завершает рассуждение по состоянию, а не после заданного числа шагов.

Точность выросла без расширения поиска

SoT проверяли на трёх замороженных LLM — Llama-3.1-8B, Qwen2.5-14B и Mixtral-8x7B — и на шестнадцати наборах задач. В них вошли математика, понимание текста, символьная логика, программирование и работа с длинным контекстом. Для сравнения использовали обычную генерацию, цепочки рассуждений, планирование, самопроверку, выбор из нескольких ответов, древовидный поиск, методы управления памятью и рассуждение в скрытом пространстве.

На Llama-3.1-8B средний выигрыш по группам задач составил 10,8 процентного пункта относительно сильнейшего конкурирующего метода в каждой группе. SoT показал лучший или равный лучшему результат на тринадцати наборах из шестнадцати. Разница проявилась не только на математике: самый крупный относительный прирост пришёлся на задачи с длинным контекстом, где особенно важно не переносить всю историю без разбора.

Метод также перенесли на две версии Qwen2.5-VL и проверили на задачах, где нужно совместно анализировать изображение и текст. Результат сохранился: контроллер повышал среднюю точность и тратил меньше токенов, чем методы с поиском. Это поддерживает основную гипотезу работы: полезен не конкретный шаблон рассуждения, а выбор свидетельств по текущему состоянию модели.

Границы проверки заданы публичными наборами задач и замороженными моделями нескольких архитектур. Замеры показывают поведение на воспроизводимых задачах с известным правильным ответом, но не заменяют испытание на агентном процессе, где есть вызовы инструментов, изменяемое состояние и ошибки внешних систем.

Что меняется в архитектуре продукта

Для команды, которая запускает модель на собственной инфраструктуре, работа предлагает новый вариант распределения вычислений. Вместо увеличения числа попыток можно добавить небольшой контроллер между шагами генерации: он сокращает активную историю и останавливает вывод, когда состояние стабилизировалось. Это особенно уместно там, где стоимость определяют длина контекста и задержка нескольких последовательных вызовов.

Такой переход нельзя свести к замене системной подсказки. Полная версия SoT требует доступа к внутренним представлениям LLM, разделения рассуждения на смысловые шаги и собственного цикла вывода. Команде также понадобится собрать траектории на своих задачах и обучить контроллер выбирать полезную историю. Малый размер контроллера снижает стоимость обучения, но не отменяет изменений в сервере вывода и наблюдаемости.

Для моделей, доступных только через API, полную схему применить нельзя: интерфейс не отдаёт скрытые состояния. В работе есть вариант, который вместо них использует векторные представления текста рассуждения. Он уступил полной версии примерно 18% по средней точности, но остался сопоставим с сильными базовыми методами на части задач. Это делает идею применимой при ограниченном доступе, хотя экономию задержки придётся проверять с учётом дополнительных проходов кодировщика.

Менять выбранную модель из-за одной работы рано. Практический вывод уже применим на уровне эксперимента: если продукт расходует бюджет на длинные цепочки или поиск по вариантам, стоит сравнить этот подход с текущей схемой на одинаковом лимите времени и токенов. SoT предлагает оптимизировать не длину рассуждения как таковую, а решение о том, какую часть истории модель использует дальше.

Источники

Иллюстрация: рисунок из статьи «State of Thought Enables Endogenous Reasoning», Zhiren Gong, Yikun Hou, Zihao Zeng и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу