Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Yigit Utku Bulut из Johannes Kepler University Linz предложил два контрольных теста для траекторий рассуждения LLM; работа опубликована как препринт, не проходивший рецензирования. После контроля только 1 из 178 пар «задача — модель» сохранила признаки того, что решение стало доступно благодаря накопленному рассуждению. Результат важен для команд, которые выбирают момент остановки модели, распределяют вычислительный бюджет или пытаются предсказывать правильность ответа по первым токенам.
Что сделали
Авторы обрезали траекторию в нескольких точках и сравнивали два варианта: продолжить рассуждение с сохранённого начала или запустить решение заново с тем же общим бюджетом сгенерированных токенов. Такой контроль разделяет ценность начала траектории и более простое объяснение: оставшаяся часть решения лишь начала помещаться в доступный бюджет.
В точно сопоставимых случаях продолжение собственного рассуждения модели выиграло у перезапуска во всех 9 сравнениях. Однако увеличение бюджета перезапуска обычно позволяло достичь того же порога успешности. По интерпретации автора, накопленная траектория преимущественно сжимает вычисление, то есть экономит токены, а не открывает решения, недоступные новому запуску.
Отдельный тест проверял, предсказывают ли ранние внутренние сигналы исход конкретной попытки. Авторы добавили два контроля: прогноз только по сложности вопроса и сравнение правильных и ошибочных попыток внутри одной задачи. После этого измеримого преимущества ранних сигналов не обнаружили; высокий общий результат мог отражать распознавание сложности задачи.
Что это значит
Для проверки промежуточных рассуждений недостаточно показать, что вероятность успеха растёт после некоторой точки. Нужен перезапуск с сопоставимым бюджетом. Для прогнозирования исхода также недостаточно объединять разные задачи: модель проверки может отличать лёгкие вопросы от сложных, не определяя судьбу отдельной попытки. Практический критерий для систем адаптивного вывода — требовать оба контроля до внедрения ранней остановки или маршрутизации бюджета.
Ограничения. Работа не показывает, что результат переносится на крупные модели, другие предметные области или позиции с промежуточными ответами. Инструментированный эксперимент охватывает 89 задач MATH и две небольшие открытые модели, причём для каждой пары использована одна исходная траектория. В сравнении продолжения и перезапуска уравнено число токенов, но не измерены FLOPs, задержка и экономия от повторного использования кэша внимания. Поэтому работа оценивает доступность решения и расход токенов, а не фактическую стоимость эксплуатации.
Источники
Иллюстрация: рисунок из статьи «It's the Problem, Not the Path: Budget and Difficulty Confounds in LLM Reasoning Trajectories», Yigit Utku Bulut, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



