Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Языковую модель научили самой решать, какие прежние шаги рассуждения ей нужны дальше и когда пора остановиться. В препринте команды Nanyang Technological University, который не прошёл рецензирование и содержит замеры самих авторов, State of Thought сократил число сгенерированных токенов на 62,6%, а сквозную задержку — на 44,6%, одновременно повысив точность. Для команд с доступом к весам модели это альтернатива длинным подсказкам, повторным попыткам и поиску по нескольким веткам.
Как внутреннее состояние управляет ходом рассуждения
Обычная цепочка рассуждений задаёт модели форму снаружи: сначала разбить задачу на шаги, затем проверить ответ или построить несколько вариантов. Поиск расширяет этот подход и тратит дополнительные вычисления на ветки, среди которых затем выбирает результат. В обоих случаях программа вокруг модели определяет, как долго рассуждать и какую историю передать на следующий шаг.
State of Thought, или SoT, переносит это решение внутрь контура вывода. После каждого смыслового шага система считывает четыре сигнала из скрытых представлений модели: насколько локально сосредоточена информация, как меняется состояние, сохраняется ли направление рассуждения и насколько модель не уверена в продолжении.
Эти сигналы поступают в контроллер на 582 параметра. Он выбирает из истории только те фрагменты, которые пригодятся для следующего решения, и отдельно определяет, продолжать ли рассуждение. Исходная LLM остаётся замороженной: SoT не меняет её веса и не создаёт вторую модель сопоставимого размера.
Контроллер обучают заранее на многошаговых траекториях. Для каждого состояния ему показывают, какие предыдущие фрагменты помогли продолжить решение и в какой момент уже можно было перейти к ответу. Поэтому экономия возникает не из жёсткого ограничения длины: модель переносит вперёд меньше нерелевантного контекста и завершает рассуждение по состоянию, а не после заданного числа шагов.
Точность выросла без расширения поиска
SoT проверяли на трёх замороженных LLM — Llama-3.1-8B, Qwen2.5-14B и Mixtral-8x7B — и на шестнадцати наборах задач. В них вошли математика, понимание текста, символьная логика, программирование и работа с длинным контекстом. Для сравнения использовали обычную генерацию, цепочки рассуждений, планирование, самопроверку, выбор из нескольких ответов, древовидный поиск, методы управления памятью и рассуждение в скрытом пространстве.
На Llama-3.1-8B средний выигрыш по группам задач составил 10,8 процентного пункта относительно сильнейшего конкурирующего метода в каждой группе. SoT показал лучший или равный лучшему результат на тринадцати наборах из шестнадцати. Разница проявилась не только на математике: самый крупный относительный прирост пришёлся на задачи с длинным контекстом, где особенно важно не переносить всю историю без разбора.
Метод также перенесли на две версии Qwen2.5-VL и проверили на задачах, где нужно совместно анализировать изображение и текст. Результат сохранился: контроллер повышал среднюю точность и тратил меньше токенов, чем методы с поиском. Это поддерживает основную гипотезу работы: полезен не конкретный шаблон рассуждения, а выбор свидетельств по текущему состоянию модели.
Границы проверки заданы публичными наборами задач и замороженными моделями нескольких архитектур. Замеры показывают поведение на воспроизводимых задачах с известным правильным ответом, но не заменяют испытание на агентном процессе, где есть вызовы инструментов, изменяемое состояние и ошибки внешних систем.
Что меняется в архитектуре продукта
Для команды, которая запускает модель на собственной инфраструктуре, работа предлагает новый вариант распределения вычислений. Вместо увеличения числа попыток можно добавить небольшой контроллер между шагами генерации: он сокращает активную историю и останавливает вывод, когда состояние стабилизировалось. Это особенно уместно там, где стоимость определяют длина контекста и задержка нескольких последовательных вызовов.
Такой переход нельзя свести к замене системной подсказки. Полная версия SoT требует доступа к внутренним представлениям LLM, разделения рассуждения на смысловые шаги и собственного цикла вывода. Команде также понадобится собрать траектории на своих задачах и обучить контроллер выбирать полезную историю. Малый размер контроллера снижает стоимость обучения, но не отменяет изменений в сервере вывода и наблюдаемости.
Для моделей, доступных только через API, полную схему применить нельзя: интерфейс не отдаёт скрытые состояния. В работе есть вариант, который вместо них использует векторные представления текста рассуждения. Он уступил полной версии примерно 18% по средней точности, но остался сопоставим с сильными базовыми методами на части задач. Это делает идею применимой при ограниченном доступе, хотя экономию задержки придётся проверять с учётом дополнительных проходов кодировщика.
Менять выбранную модель из-за одной работы рано. Практический вывод уже применим на уровне эксперимента: если продукт расходует бюджет на длинные цепочки или поиск по вариантам, стоит сравнить этот подход с текущей схемой на одинаковом лимите времени и токенов. SoT предлагает оптимизировать не длину рассуждения как таковую, а решение о том, какую часть истории модель использует дальше.
Источники
Иллюстрация: рисунок из статьи «State of Thought Enables Endogenous Reasoning», Zhiren Gong, Yikun Hou, Zihao Zeng и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



