Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Латентное рассуждение научили перенимать структуру длинной цепочки решения, не заставляя модель печатать её целиком. В работе Shanghai Jiao Tong University и Taobao & Tmall Group метод PMPS повысил долю правильных итоговых ответов в среднем на 2,08 процентного пункта относительно SIM-CoT при сопоставимой длине вывода, хотя препринт не рецензирован и все числа получили сами авторы. Это даёт командам способ сократить генерацию без дополнительных вычислений при запуске модели, если они готовы менять её обучение.
Как прототипы связывают короткое скрытое решение с длинным текстом
Латентные методы заменяют текстовую цепочку рассуждений последовательностью скрытых векторных представлений. Модель обрабатывает их внутри, а наружу выводит только ответ. Число таких позиций можно задать заранее, поэтому вывод получается короче.
Проблема возникает при обучении. Если проверять только итоговый ответ, промежуточные представления могут стать почти одинаковыми и перестать хранить разные части решения. CODI, например, связывает учителя и ученика лишь в позиции ответа, а SIM-CoT жёстко сопоставляет каждую скрытую позицию одному шагу явного рассуждения.
PMPS обучает две ветви одной модели параллельно. Учитель решает задачу с явной цепочкой рассуждений, ученик использует короткую латентную последовательность. Их представления проходят через общий проекционный блок и распределяются между обучаемыми прототипами — векторами, которые служат смысловыми ориентирами.
Алгоритм Sinkhorn-Knopp балансирует распределение, чтобы все представления не собрались вокруг одного прототипа. После этого PMPS строит мягкое соответствие «многие ко многим»: одна латентная позиция может сжать несколько фрагментов явного решения, а один фрагмент может влиять на несколько латентных позиций.
Обучающий сигнал идёт в обе стороны. Латентные представления должны воспроизводить смысловую структуру явной цепочки, а явная цепочка уточняет общее пространство прототипов. Это не требует делить решение на заранее размеченные шаги одинаковой длины.
Отдельный модуль PSA сначала поощряет совпадения между близкими позициями: начало скрытой последовательности тяготеет к началу решения, конец — к концу. По мере обучения это правило ослабевает, и модель может объединять или перераспределять части рассуждения по смыслу, а не только по порядку.
Где короткое рассуждение сохранило точность
Основные опыты провели на GPT-2, Qwen2.5-0.5B-Instruct и Llama-3.2-1B-Instruct. Модели обучали на GSM8K-Aug, где решения записаны арифметическими выражениями, а затем проверяли на GSM-Hard, SVAMP и MultiArith. Сравнение охватывало CoT-SFT, Coconut, CoLaR-2, Latent-SFT, CODI и SIM-CoT; качество измеряли долей правильных числовых ответов, длину — количеством сгенерированных токенов.
На GPT-2 вывод PMPS занимал меньше половины длины явной цепочки и при этом оказался точнее CoT-SFT. Среди латентных методов PMPS показал лучший средний результат на всех трёх основных семействах моделей при близкой длине ответа.
На более сложном MATH скрытая последовательность занимала 13% длины вывода CoT-SFT, а средняя точность превосходила CODI на 2,1 процентного пункта. Решения в MATH записаны свободным текстом без явных границ между шагами, поэтому мягкое сопоставление не зависело от разметки структуры ответа.
Разбор компонентов показывает, откуда пришёл выигрыш. Без направления обучения от латентных представлений к явной цепочке средняя точность падала на 3,78 пункта. Замена прототипов прямым сравнением векторов стоила 3,49 пункта, а удаление PSA — 0,76 пункта: основную роль сыграла смысловая структура прототипов, тогда как порядок дал меньшую, но устойчивую прибавку.
Проверка скрытых представлений также показала разницу в поведении методов. У CODI позиции группировались по чётности, а у SIM-CoT последние позиции становились почти одинаковыми. У PMPS этих двух схем схлопывания не возникло, поскольку каждая позиция получала сигнал через мягкое соответствие с явным решением.
Что меняется в планах разработки
Работа не меняет выбор базовой модели сама по себе. Она меняет способ дообучения, если продукту нужно сократить последовательную генерацию рассуждений, но сохранить контроль над промежуточным процессом.
PMPS требует доступа к скрытым состояниям и к циклу обучения: нужно параллельно запускать ветвь с явным решением и латентную ветвь. Поэтому метод подходит командам, которые дообучают собственную модель или открытую модель, а не используют только закрытый API для генерации ответов.
Проекционный блок и прототипы добавляют при обучении менее 2 млн параметров, то есть меньше 1% базовой модели. Для сравнения, вспомогательный декодер SIM-CoT фактически удваивает число обучаемых параметров. После обучения учитель, прототипы и PSA удаляются, поэтому при запуске остаётся только латентная ветвь.
Практический план выглядит как отдельный эксперимент с функцией потерь, а не как смена архитектуры сервиса. Сначала потребуется собрать явные решения для обучения, выбрать фиксированную длину латентной последовательности и проверить точность вместе с задержкой на своих задачах. Работа охватывает прежде всего математические рассуждения, поэтому перенос на код, планирование или бизнес-процессы ещё требует собственных замеров.
Источники
Иллюстрация: рисунок из статьи «Structural Process Supervision for Latent Chain-of-Thought Reasoning», Yiqi Li, Xu Chen, Chen Ju и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



