Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новый способ онлайн-дистилляции OLIVE учит модель на продолжениях, которые учитель строит для её собственных незавершённых попыток. Команда четырёх университетов и IBM получила на ScienceWorld результат на 13% выше обычного обучения на текстах того же учителя, хотя препринт не рецензирован и все числа получили сами авторы. Метод позволяет использовать закрытую модель через текстовый API и не собирать заранее фиксированный набор полных ответов.
Как учитель продолжает попытку студента
При обычной дистилляции учитель заранее решает задачи, а студент обучается повторять готовые траектории. На практике студент ошибается иначе, попадает в другие состояния и затем вынужден продолжать собственный неудачный ответ — таких контекстов в фиксированном наборе учителя нет.
OLIVE начинает каждый шаг обучения с текущей версии студента. Студент получает задачу и генерирует начало ответа, после чего учитель принимает этот текст как контекст и дописывает продолжение. Затем студент обучается только на токенах учителя: его собственный префикс остаётся во входном контексте, но не входит в функцию потерь по перекрёстной энтропии.
После обновления цикл повторяется. Поэтому новые префиксы отражают уже изменившееся поведение студента, а учитель разбирает состояния, в которые тот попадает сейчас, а не до начала обучения. Авторы не фильтровали префиксы и не требовали, чтобы продолжение содержало полный проверенный ответ.
Это отличает OLIVE от онлайн-дистилляции OPD. В OPD учитель оценивает токены вдоль исходной траектории студента: если в начале нужна коррекция, последующие оценки всё равно относятся к продолжению, которое студент построил без неё. В OLIVE учитель сам выбирает следующий токен, а затем продолжает уже собственное исправление.
Для многошаговых агентов префикс состоит из действий студента и ответов среды. Затем учитель перехватывает управление, выполняет следующие действия и получает новые наблюдения. При обновлении модель обучается на действиях учителя, но не на наблюдениях среды и не на предыдущих действиях студента.
Учитель отдаёт только текст. OLIVE заново разбивает его токенизатором студента, поэтому модели могут использовать разные словари, а API учителя не обязан раскрывать вероятности отдельных токенов. Это главное практическое отличие от дистилляции, которая сопоставляет распределения двух моделей.
Обновляемые префиксы помогают на длинных траекториях
Рассуждения проверяли на двух моделях Qwen3 в синтетической среде RLVE с задачами, для которых ответ можно автоматически проверить. Агентную часть проверяли в пяти средах AgentGym, включая ALFWorld, ScienceWorld и TextCraft. OLIVE сравнивали с обучением на фиксированных ответах учителя, OPD и другими способами вмешательства при одинаковом бюджете обучения.
На сложных задачах рассуждения доля примеров, решённых хотя бы в одной из восьми попыток, выросла на 6–8 процентных пунктов. На агентных задачах средний результат по четырём попыткам прибавил 7–22%.
На ScienceWorld OLIVE поднял успешность почти неработавшего исходного студента до 7,5%, тогда как OPD не смогла его улучшить. Этот результат показывает разницу между оценкой ошибочной траектории и демонстрацией того, как продолжать после перехвата управления.
Учитель создаёт продолжения медленнее, чем студент обновляет веса, поэтому авторы вынесли генерацию в параллельный процесс. Пока учитель дописывает одну партию, студент готовит префиксы для следующей; такая схема сократила полное время обучения на 23,8%.
После обучения модель также проверили на математике, программировании, естественных науках и следовании инструкциям. Среднее падение результата составило 0,9%, то есть выигрыш на целевых задачах не сопровождался сопоставимой потерей общих навыков.
Когда OLIVE меняет план обучения
Работа меняет план команды, если она собиралась один раз выгрузить ответы сильной модели и обучать студента на неизменном наборе. Для длинных рассуждений и агентов такой набор быстро расходится с поведением обновлённого студента. OLIVE превращает подготовку данных в часть цикла обучения: новая версия модели сама создаёт контексты для следующего обращения к учителю.
Метод также открывает вариант дистилляции из закрытого API. Достаточно передать учителю условие и префикс, получить продолжение и обучить студента на этом фрагменте. Доступ к внутренним оценкам вероятности не нужен, поэтому архитектура учителя, его токенизатор и способ размещения могут отличаться от студента.
Цена этой схемы — более сложный контур обучения. Нужно одновременно обслуживать генерацию студента, запросы к учителю, очередь готовых продолжений и обновление весов. Для агента среда должна позволять передать учителю полную историю и продолжить тот же эпизод; простого журнала финальных ответов недостаточно.
Работа не заменяет обычное обучение с учителем для всех задач. Проверки сосредоточены на сложных рассуждениях и многошаговом взаимодействии, где ранняя ошибка меняет дальнейший контекст. В работе нет пересчёта запросов к учителю в денежную стоимость API, поэтому этот бюджет команде придётся оценить отдельно.
Практический вывод — не обязательно просить сильную модель решать всё с начала. Если слабая модель уже способна начать задачу, полезнее регулярно показывать учителю её текущее состояние и обучать на следующем правильном участке. OLIVE оформляет этот цикл в процедуру, которая совместима и с собственным учителем, и с внешней моделью, доступной только по текстовому интерфейсу.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



