Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Обучение компактного многошагового агента можно ускорить, если не заставлять его каждый раз проходить диалог до конца. В препринте, который не прошёл рецензирование и содержит замеры самих авторов, STRIDE сохранил качество полной дистилляции при ускорении в 3,73 раза. Метод меняет расчёт вычислительного бюджета для команд, у которых основное время уходит на генерацию новых траекторий моделью-учеником.
Сигнал учителя слабеет после первого неверного действия
При дистилляции на данных текущей модели (on-policy distillation) ученик сам генерирует ответы, а более крупная модель-учитель оценивает каждый созданный токен. Так ученик тренируется на состояниях, в которые действительно попадает, но для каждого обновления приходится заново проводить его через среду.
Авторы проверили, где оценки учителя остаются полезными. Анализ охватил 456 заданий и 5856 ходов из розничного раздела τ2-bench; учеником служил Qwen3-4B, учителем — Qwen3-30B-A3B-Thinking-2507.
Внутри одного хода полезный сигнал сосредоточен в начале ответа. По мере генерации оценки учителя хуже различают удачные и неудачные продолжения, поэтому обработка всего ответа расходует вычисления на менее содержательный материал.
Между ходами картина другая: качество сигнала не снижается постепенно только из-за длины диалога. Резкий спад совпадает с первым неверным действием агента. После него среда возвращает состояние, которое уже отклонилось от правильной траектории, и последующие оценки учителя становятся менее надёжными.
Фиксированный предел по токенам или ходам не учитывает эту границу. Он обрывает часть правильных сложных траекторий слишком рано, а короткие ошибочные траектории продолжает генерировать после того, как полезный сигнал уже исчез.
Как STRIDE решает, где остановиться и откуда продолжить
STRIDE следит за средней логарифмической вероятностью, которую учитель присваивает токенам каждого хода. Эта величина показывает, насколько созданное учеником действие похоже на варианты, которые поддерживает учитель.
Метод суммирует оценки по ходу траектории и прекращает прогон, когда сумма пересекает заданный порог. Ошибочный ход не выбрасывается: его токены участвуют в обучении и дают ученику корректирующий сигнал. Не генерируются только следующие ходы, где агент уже действует в отклонившемся состоянии.
Одной ранней остановки недостаточно. Если каждый новый прогон снова начинать с первого хода, модель будет хорошо осваивать начало задачи, но редко доберётся до поздних действий.
Поэтому STRIDE хранит качественные префиксы траекторий. Следующий прогон той же задачи начинается с самого слабого хода среди ещё правильных: предыдущая часть не генерируется заново, а модель тренируется вокруг текущего места ошибки. По мере улучшения ученика точка перезапуска сдвигается дальше, и получается учебная программа без заранее заданного расписания.
Фильтр качества здесь обязателен. Если сохранить префикс с ошибочным состоянием, следующий прогон почти сразу пересечёт порог остановки и перестанет давать достаточно новых токенов. В опытах буфер без такого фильтра сначала работал наравне с полным вариантом, а затем качество обучения падало.
Когда STRIDE меняет план обучения
На розничных задачах τ2-bench STRIDE сравнялся с полной дистилляцией и превзошёл учителя при ускорении в 3,73 раза. При менее агрессивной остановке метод уже обошёл полную дистилляцию, сохранив ускорение в 2,34 раза.
В обучении с отдельными учителями для розничных и телекоммуникационных задач ускорение составило 4,51 раза. Это показывает, что схема работает не только с одним учителем, хотя на более длинных телекоммуникационных сценариях точка обучения продвигается по траектории медленнее.
Дополнительная проверка на математических задачах дала ускорение в 5,10 раза на одной настройке и в 3,08 раза на другой. STRIDE в каждом случае улучшал результат полной дистилляции на одном из двух наборов AIME, но уступал ей на втором либо оставался близко. Фиксированное усечение в среднем не достигло качества полной версии.
Работа меняет планы команд, которые уже используют дистилляцию на свежих траекториях и упираются в длительность прогонов. Вместо общего лимита ходов можно заложить онлайн-остановку и хранение проверенных префиксов. Оценка учителя для этого уже вычисляется в процессе обучения, поэтому STRIDE не вводит отдельную модель-оценщик.
Переносить коэффициенты ускорения прямо в смету пока рано. Замеры охватывают τ2-bench в двух доменах и математические задачи, а время считали на шаг обучения без оценки качества. Метод также предполагает, что систему можно продолжить с сохранённого состояния задачи; без такого перезапуска останется только ранняя остановка, которая в опытах чаще проигрывала полному STRIDE.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



