Журнал · Rit.work

Короткая память отделяет рассуждение LLM от распознавания шаблонов

Эксперименты с Qwen показывают, как явное состояние задачи помогает LLM собирать длинные решения из коротких шагов и почему слишком частые состояния делают модель хрупкой.

Rit.work
Студия разработки
8 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM учится рассуждать шаг за шагом, когда каждый следующий шаг зависит от короткого недавнего контекста, а не от всей предыдущей цепочки. Хотя препринт University of Pennsylvania не рецензирован и числа получили сами авторы, Qwen3 сохранили свыше 75% исходной точности при окне внимания короче 15% полной цепочки. Значит, длинная история рассуждения нужна модели не всегда: её может заменить компактное и регулярно обновляемое состояние задачи.

Работа описывает рассуждение как движение по графу де Брёйна. Его узлы хранят последние токены, а рёбра задают допустимые следующие шаги. Если модель выучила рёбра, она может собирать из них новые пути, в том числе более длинные, чем цепочки в обучающих данных; когда же следующий токен зависит почти от всей истории, поведение больше похоже на распознавание знакомого шаблона.

Эту структуру можно создать явно: периодически записывать состояние — например, текущее уравнение после выполненной операции. При дообучении Qwen2.5-1.5B-Instruct частые состояния повышали точность и помогали получать правильные промежуточные шаги на меньшем объёме примеров. Без таких записей пошаговая модель решала задачи не лучше варианта, который сразу выдавал ответ.

У частых состояний есть цена. Если в цепочку подставляли лишнюю операцию, не менявшую итоговый ответ, модель сильнее зависела от ошибочного состояния и переносила ошибку дальше. Умеренная частота записей давала более ровный компромисс между точностью и устойчивостью.

Проверка охватила синтетические графы, решение уравнений и вопросы по историям, а сокращённое внимание тестировали на Qwen3-14B и Qwen3-32B с GSM8K, MATH-500 и GPQA-Diamond. Для систем с пошаговым выводом практический ориентир состоит не в том, чтобы сохранять всю историю, а в том, чтобы подобрать компактное состояние и частоту его обновления: слишком редкое состояние не помогает собирать шаги, слишком частое усиливает последствия локальной ошибки.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу