Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Yuxiang Wang, Kunyu Feng, Yingda Shen, Haoning Xu, Junyu Wang и Zhizheng Wu представили RecurTrace в препринте, который не проходил рецензирования. В контролируемом эксперименте адаптивная глубина дала преимущество в 2,2 процентного пункта над лучшим фиксированным режимом при сопоставимом объёме вычислений. Работа важна командам, которые самостоятельно развёртывают модели с открытыми весами и готовы изменять их внутреннюю архитектуру.
Что сделали
RecurTrace построен вокруг повторного выполнения небольшого блока средних слоёв Qwen3. Модель несколько раз пропускает через него скрытые представления, увеличивая фактическую глубину вычислений без генерации дополнительных токенов и без копирования весов блока.
У обычной схемы с повторением слоёв есть два недостатка. Каждый новый цикл получает только результат предыдущего и не может напрямую обратиться к более ранним вычислениям. Кроме того, заранее заданная глубина одинакова для простых и сложных запросов: лишние проходы расходуют вычисления, а иногда ухудшают ответ.
Для сохранения истории авторы добавили механизм внимания к памяти циклов (Loop Memory Attention). На каждом повторе слой может читать собственные состояния из короткого скользящего окна прошлых циклов. Обращение происходит отдельно для каждой позиции токена, поэтому память не смешивает текущую позицию с будущими и не нарушает причинный порядок генерации.
За глубину отвечает голова остановки — небольшой классификатор, который после очередного прохода решает, продолжать ли вычисления. Его обучают по сигналу от «оракула»: во время обучения система проверяет, снижает ли более глубокий проход функцию потерь, то есть численную меру ошибки модели. На инференсе доступ к будущей глубине уже не нужен, решение принимает обученный классификатор.
Основные веса Qwen3 остаются замороженными. Обучаются память, повторно используемый блок, механизм возврата исходного представления и голова остановки; вместе они добавляют до 2,2% параметров. Это делает подход ближе к специализированной надстройке над готовой моделью, чем к её полному переобучению.
Что показали
В основном контролируемом сравнении на MathQA RecurTrace достиг точности 56,9% при средней глубине 2,0 цикла. Лучший режим с заранее заданной глубиной дал 54,7%. По проверке авторов, различие статистически значимо.
ACT и PonderNet, которые управляют вычислениями через штраф или заранее заданное распределение глубины, останавливались на минимальном режиме. CALM, ориентирующийся на уверенность модели, напротив, расходовал больше циклов без сопоставимого роста точности. Более близкие методы LoopUS-Conf и TaH-Mismatch подошли к RecurTrace по вычислительному бюджету, но уступили по качеству.
Авторы также сравнили RecurTrace с дообученной при том же бюджете базовой моделью. На Qwen3-8B средняя точность генерации выросла на 3,4 процентного пункта. В этом опыте использовалась фиксированная глубина, поэтому результат относится к памяти циклов, а не к адаптивной остановке.
Ограничения
Адаптивную остановку подробно проверяли только на MathQA и модели размера 1,7B. Эксперименты на других масштабах не показывают, сохранится ли преимущество выбора глубины для каждого запроса: там авторы использовали фиксированное число повторов.
Обучающая смесь содержала около 1,15 миллиона примеров с короткими прямыми ответами, а итоговое сравнение охватывало 22 задачи. Часть задач относилась к тем же типам рассуждений, что и обучающие данные. Работа не показывает качество на длинных свободных ответах, программировании, диалогах и прикладных данных компаний.
Все основные опыты проведены на семействе Qwen3. Среди приведённых сравнений нет замеров производственной задержки, пропускной способности и расхода памяти GPU, а также прямого экспериментального сопоставления с моделями, использующими внешнее хранилище состояний. Среднее число циклов позволяет приблизительно сравнить вычислительную глубину, но не заменяет измерение полной стоимости инференса.
Что это значит
Работа не требует менять планы команд, использующих закрытые модели через API. RecurTrace нужен доступ к скрытым состояниям, коду слоёв, обучению дополнительных модулей и собственному контуру инференса. Добавить такой механизм поверх обычного API нельзя.
Для команд, которые развёртывают Qwen3 или похожую модель самостоятельно, результат оправдывает отдельный прототип. Особенно уместны задачи с коротким проверяемым ответом, где дополнительное скрытое вычисление предпочтительнее длинной цепочки рассуждений в выходных токенах. Проверять нужно одновременно качество, задержку, пропускную способность и память на реальном распределении запросов.
Практически значим и отрицательный результат: одной головы остановки недостаточно. В опытах она стремилась завершать вычисления слишком рано, поэтому авторам понадобилась обязательная минимальная глубина. Следовательно, адаптивные вычисления нельзя закладывать в архитектуру как автоматическую экономию GPU — режим остановки придётся калибровать на данных продукта.
Оснований заменять текущую модель или отказываться от масштабирования параметров пока нет. RecurTrace меняет скорее исследовательский план: если продукт уже строится на модифицируемой Qwen3 и качество ограничено многошаговыми рассуждениями, память между циклами стоит сравнить с базовой моделью, более крупным вариантом и генерацией явных промежуточных шагов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



