Журнал · Rit.work

TokenProbe сжимает рассуждения LLM по уверенности токенов

Метод выделяет опорные фрагменты цепочки рассуждений по внутренним оценкам модели и сокращает лишние токены во время обучения.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Длинные цепочки рассуждений LLM можно сокращать, сохраняя шаги, которые ведут к ответу, и убирая повторные проверки и тупиковые ветви. Хотя работа команды из Purdue University, MIT-IBM Watson AI Lab, Meta AI и других организаций не рецензирована и все замеры принадлежат авторам, предложенный метод сократил вывод до 76% относительно исходного объёма без сопоставимой потери качества. Для команд со своими моделями это превращает борьбу с многословием из настройки ограничения длины в отдельную задачу обучения.

Лог-вероятность показывает, где модель уверена в ходе решения

При генерации модель оценивает вероятность каждого следующего токена. Логарифм этой вероятности уже доступен внутри процесса вывода: чем выше значение, тем ожидаемее выбранный токен с учётом вопроса и предыдущего текста.

Сырые значения нельзя напрямую сравнивать между ответами, поэтому авторы нормализуют их отдельно внутри каждой цепочки. Из лог-вероятности токена вычитают среднее по ответу и делят результат на стандартное отклонение. Положительное значение означает, что модель увереннее в этом токене, чем в среднем по текущему рассуждению.

Доля токенов с положительным значением образует показатель TokenProbe. Высокий TokenProbe связан одновременно с более точными и более короткими ответами. Это не просто измеритель длины: короткая, но ошибочная цепочка не получает преимущества автоматически.

Сигнал различает даже одинаковые слова в разных частях одного ответа. Раннее Wait сопровождало полезную перепроверку условия, а позднее означало возврат к уже подтверждённому шагу и породило ещё 700 токенов. Первое получило положительную нормализованную лог-вероятность, второе — отрицательную.

Для обучения метод не выбирает отдельные слова по одному. Он проводит по цепочке окно фиксированной длины, суммирует оценки внутри него и выбирает непересекающиеся фрагменты с максимальной суммой. Такие окна считаются ядром рассуждения, остальные токены — кандидатами на сжатие.

GRPO сохраняет ядро и давит лишние продолжения

TokenProbe встроили в GRPO — метод обучения, который сравнивает несколько ответов модели на одну задачу и усиливает варианты с большей наградой. Обычный GRPO применяет одинаковые правила ко всем токенам, хотя один фрагмент может содержать решающий переход, а другой — повторять уже сделанный вывод.

Авторы предложили два варианта. Первый сохраняет обычную регуляризацию для опорных токенов, чтобы модель не теряла важные шаги. Если ответ превышает заданный бюджет, лишние токены получают давление на сокращение, тогда как умеренную избыточность внутри бюджета метод допускает.

Второй вариант меняет награду. В правильных ответах он усиливает токены из опорных окон и штрафует длинные избыточные участки. Для ошибочных ответов правила GRPO не меняются: иначе обучение могло бы закрепить уверенно написанный, но неверный ход решения.

Это принципиально отличается от жёсткого обрезания вывода. На Qwen-4B ограничение длины без дополнительного обучения резко снижало точность, тогда как TokenProbe учил модель раньше завершать ненужные ветви и сохранять связный путь к ответу.

Экономия токенов требует собственного цикла обучения

На Qwen-4B вариант с выборочной регуляризацией сократил средний ответ с 6132 до 1886 токенов. Средняя точность на математических задачах изменилась с 62,4% до 61,0%. Простое ограничение исходной модели тем же бюджетом, напротив, снижало точность на 30,5 процентного пункта.

Главные сравнения проведены на AIME, MATH, AMC и Olympiad-Bench с моделями семейств Qwen, DeepScaleR и Phi-Reasoning. Практический вывод поэтому относится прежде всего к многошаговым математическим рассуждениям; перенос отдельно проверяли на MMLU, MMLU-Pro, LSAT и GPQA.

Работа меняет планы команд, которые дообучают открытые модели через GRPO. TokenProbe использует лог-вероятности, уже полученные при генерации, а выбор окон выполняется на центральном процессоре. После обучения дополнительный компонент во время вывода не нужен: контроль длины остаётся в весах модели, и стандартный вызов генерации не меняется.

Для продукта, который только вызывает закрытый API, метод нельзя применить к весам поставщика. В таком проекте работа скорее даёт критерий для сравнения моделей при одинаковом бюджете вывода, чем готовый способ снизить расход токенов.

Заменить обучение обычной дистилляцией также не получилось: проверенные варианты обучения по готовым ответам потеряли от 33 до 51 процентного пункта точности. Кроме того, некоторые запуски на инструктивных моделях уходили в повторяющиеся циклы. Значит, TokenProbe стоит рассматривать как направление для отдельного эксперимента с контрольным набором задач, а не как безопасную настройку существующего конвейера.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу