Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Более сильную языковую модель научили подключаться только там, где рассуждение ученика заметно отклоняется от её варианта. Команда Nanyang Technological University и Baidu представила MAESTRO: в препринте, который не рецензирован и где все числа получили сами авторы, метод сократил среднюю длину обучающего ответа на 67,3%. Для команд это способ тратить генерацию учителя избирательно, а не добавлять её по фиксированному расписанию.
Глубокое вмешательство улучшает траекторию, но меняет учебные данные
Работа посвящена дистилляции на собственных траекториях ученика (on-policy distillation, OPD). Ученик генерирует рассуждение, а более сильная модель оценивает вероятности следующих токенов и задаёт обучающий сигнал. Такой подход сохраняет данные близкими к поведению ученика, но ранняя ошибка может увести всю последующую цепочку в бесполезную сторону.
Учитель может перехватить генерацию, исправить направление и затем вернуть управление. Проблема в том, что ученик продолжает уже не со своего префикса. Чем дольше отвечает учитель, тем сильнее учебные данные отличаются от распределения, которое ученик создаёт самостоятельно.
Контролируемые опыты показали, что польза и цена вмешательства растут неравномерно. Первые фрагменты учителя быстро повышают точность готовой траектории, а дальнейшее расширение даёт всё меньшую прибавку. Одновременно даже короткий перехват заметно увеличивает сдвиг от распределения ученика.
Качество отдельного ответа при этом не предсказывает итог обучения. При доле вмешательства 15,6% ученик достиг пиковой точности 68,5%, а при примерно вдвое более сильном вмешательстве — только 64,5%. Зато более глубокое участие учителя лучше удерживало результат после пика.
Единого места для перехвата тоже не оказалось. Сложные задачи требовали более длинных фрагментов учителя, а лучший момент зависел от того, насколько далеко продвинулось рассуждение. Поэтому фиксированное правило вроде «подключать учителя после первого абзаца» не решает задачу распределения вычислений.
MAESTRO сверяет учителя и ученика на границах абзацев
MAESTRO измеряет локальное расхождение между моделями. Метод проверяет, входят ли предпочитаемые учителем токены в число вероятных вариантов ученика, а затем сравнивает, как обе модели распределяют между ними вероятность. Сильное несовпадение означает, что ученик, вероятно, выбрал другое направление рассуждения.
Проверка идёт не по одному токену, а по абзацу рассуждения. Ранние позиции получают больший вес, потому что начало шага чаще определяет его дальнейшее направление. Это снижает вероятность перехвата из-за единичного колебания вероятностей.
На границе абзаца MAESTRO сравнивает итоговую оценку с порогом. Если расхождение невелико, ученик продолжает сам. Если оно превышает порог, учитель берёт управление; чем сильнее модели расходятся, тем длиннее его фрагмент. Число таких перехватов в одной траектории ограничено, а после последнего генерация завершается.
На младшей версии Qwen3 средняя точность MAESTRO составила 31,36% против 29,71% у Relay-OPD. На старшей версии результаты достигли 47,12% и 45,18% соответственно. Разрыв невелик, но MAESTRO лидировал в среднем на обоих размерах ученика, а старшая модель заняла первое место на каждом использованном наборе задач.
Сокращение обучающих ответов возникает не потому, что учитель генерирует всё решение. После исправления направления метод не требует длинного продолжения от ученика и обрывает траекторию раньше. Длина ответа показывает объём генерации, но не заменяет прямой замер расходов на GPU или времени полного цикла обучения.
Для продукта это пока настройка обучения, а не новый базовый выбор
Метод проверяли на двух учениках Qwen3 — с 0,6 и 1,7 млрд параметров — и на восьми наборах математических задач. Сравнение охватывает обычную дистилляцию, обучение с подкреплением, OPD и несколько способов вмешательства в траекторию. Одинаковую конфигурацию MAESTRO использовали для обоих размеров модели и всех наборов.
Такие границы делают вывод практичным для команд, которые уже обучают небольшую модель рассуждать с помощью более сильного учителя. Вместо увеличения общей доли учительских токенов можно сначала измерять локальное расхождение, а затем совместно настраивать момент и длину перехвата. Особенно полезен эксперимент там, где задачи сильно различаются по сложности.
Работа не даёт основания менять базовую модель продукта или переносить результат на диалоги, поиск и программирование без собственной проверки. Все основные замеры относятся к математическим рассуждениям и сравнительно небольшим Qwen3. Значит, ближайший шаг для команды — не перестраивать весь контур обучения, а провести ограниченный опыт на своих траекториях и отдельно измерить точность, длину генерации и фактическую загрузку GPU.
Главный инженерный вывод касается критерия вмешательства. Максимально качественная траектория не обязательно лучше всего обучает ученика: учитель одновременно исправляет ошибку и уводит данные от поведения модели. Поэтому при проектировании дистилляции нужно оптимизировать не объём помощи, а баланс между коррекцией и сохранением собственных состояний ученика.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



