Журнал · Rit.work

Osprey переиспользует основу черновой модели между LLM

Osprey сохраняет общее языковое обучение при смене целевой LLM, но окупает предварительную подготовку только при больших объёмах генерации или работе с несколькими моделями.

Rit.work
Студия разработки
10 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Черновую модель для ускоренного декодирования научили готовить один раз, а затем приспосабливать к разным LLM. В лучшем из трёх опытов Osprey увеличил среднее число принятых токенов на 22,7% относительно EAGLE-3. Для команд с несколькими целевыми моделями это переносит общую часть обучения в переиспользуемый компонент, хотя работа не рецензирована и числа в ней получили сами авторы.

Почему черновая модель перестаёт ускорять генерацию

При спекулятивном декодировании небольшая черновая модель предлагает сразу несколько следующих токенов, а основная LLM проверяет их за один проход. Совпавшие токены остаются в ответе, а после первого отклонения генерация продолжается обычным способом. Метод ускоряет выдачу, не меняя распределение ответов целевой модели.

Качество черновой модели измеряют средней принятой длиной: сколько предложенных токенов целевая LLM одобряет подряд. Чем длиннее совпавший фрагмент, тем реже приходится запускать дорогую последовательную генерацию.

Черновые модели семейства EAGLE получают скрытые состояния конкретной LLM и учатся повторять её вероятности следующих токенов. Такая привязка помогает на знакомой нагрузке, но переносится хуже. Например, EAGLE-3, обученный на математике, показал принятую длину 5,06 на математических данных и 1,86 на коде.

Расширить обучающую смесь можно, но подготовку всё равно приходится повторять для каждой целевой архитектуры. Черновая модель зависит от её словаря, внутренних представлений и выходного распределения. Osprey отделяет общие языковые навыки от этой привязки.

Как Osprey сохраняет знания после обрезки модели

Сначала разработчики берут готовую небольшую языковую модель и оставляют в ней начальные блоки трансформера, таблицу токенов и выходной слой. Малая глубина важна: черновая модель генерирует последовательно, поэтому каждый дополнительный блок уменьшает выигрыш по задержке.

После жёсткой обрезки модель хуже предсказывает следующий токен. Osprey восстанавливает этот навык продолженным обучением на FineWeb. На этом этапе не нужны ни скрытые состояния, ни ответы целевой LLM, поэтому полученный каркас можно сохранить и использовать снова.

Затем каркас приспосабливают к словарю выбранной цели. Совпадающие токены сохраняют прежние векторы. Новый токен раскладывают на части исходным токенизатором и усредняют их векторы, чтобы не начинать обучение соответствующей строки со случайных значений.

Черновая модель также должна принимать скрытые состояния из нижней, средней и верхней частей целевой LLM. Для этого Osprey расширяет проекции внимания новыми столбцами, заполненными нулями. Сразу после изменения новые входы не влияют на вычисления, поэтому ранее обученное поведение не разрушается; влияние целевой модели появляется постепенно во время адаптации.

На последнем этапе черновик учится повторять вероятности токенов замороженной целевой LLM на сгенерированных ею последовательностях. В результате каждый развёрнутый черновик всё равно остаётся привязан к своей цели. Osprey переиспользует общее предварительное обучение, но не отменяет отдельную адаптацию под словарь, скрытые состояния и выходы каждой модели.

Когда общий каркас меняет план инфраструктуры

Osprey проверили с Qwen3-8B, Llama-3.3-70B-Instruct и MiniMax-M2.5. На последней модели пропускная способность выросла на 17,5% относительно сопоставимого EAGLE-3. Сравнение с черновиком той же глубины также показало, что преимущество даёт предварительное обучение, а не только дополнительный слой.

Короткая подготовка общего каркаса потребовала 576 H100-часов. При измеренной экономии на обслуживании MiniMax затраты окупались примерно после 0,65 млрд сгенерированных токенов. Повторное использование каркаса с несколькими целями снижает объём трафика, который должен окупить подготовку каждой из них.

Практический выбор зависит не только от объёма. Для адаптации нужен доступ к скрытым состояниям и выходному распределению целевой модели, поэтому одного внешнего API недостаточно. Кроме того, Osprey не сокращает бюджет целевой адаптации: команда экономит на повторной общей подготовке и затем на генерации.

Проверка охватила чат, код, здравый смысл, финансы, математику и многоязычные наборы при фиксированной конфигурации SGLang. Большинство результатов получили в одиночных запусках, поэтому небольшие разницы могут зависеть от настройки оборудования и обслуживания. Для малонагруженного или разового развёртывания предварительное обучение может не окупиться; для постоянного сервиса с несколькими LLM оно становится отдельным инфраструктурным активом.

Источники

Иллюстрация: рисунок из статьи «Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding», Fengxiang Bie, Yuqing Jian, Yifan Yu и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу