Журнал · Rit.work

SoFT сохраняет базовые способности при дообучении на нескольких учителях

SoFT заменяет жёсткое копирование ответов учителя мягкими целями и помогает модели осваивать смешанные задачи без заметного ущерба прежним навыкам.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковую модель научились перенимать навыки нескольких учителей и при этом лучше сохранять поведение, полученное до дообучения. Huihao Jing и соавторы предложили SoFT, который дал лучший совокупный результат во всех проверенных конфигурациях; поскольку препринт не рецензирован, все числа получены самими авторами. Для команд, которые собирают одну модель из разнородных демонстраций, это альтернатива обычному дообучению с учителем (SFT), а не новый этап обучения.

Почему точное копирование учителя мешает модели

Обычный SFT считает каждый токен демонстрации единственно правильным. Модель должна приблизить его вероятность к единице, хотя тот же ответ часто можно сформулировать иначе, выбрать другой ход рассуждения или вызвать другой подходящий инструмент.

Такая цель не учитывает исходные знания модели. Если она уже считает токен правдоподобным, SFT всё равно усиливает его. Если учитель выбрал один вариант из нескольких допустимых, обучение подавляет остальные варианты независимо от их качества. На длинных рассуждениях и последовательностях действий этот эффект накапливается.

SoFT вместо единственного правильного токена строит мягкое распределение вероятностей. Для токена учителя задают минимальную вероятность, а остальные вероятности меняют настолько мало, насколько позволяет это условие. Если базовая модель уже ставит токен выше порога, распределение не меняется. Если ниже, SoFT поднимает его до порога и пропорционально уменьшает вероятности альтернатив, сохраняя их соотношение.

Математически метод ищет ближайшее к базовой модели распределение по расхождению KL — мере различия между двумя распределениями. Получившаяся цель объединяет два сигнала: учиться у демонстрации и сохранять прежнее поведение. Чем сильнее первый, тем слабее второй, поэтому команде не приходится отдельно подбирать вес обучения и вес регуляризации.

Силу обучения задаёт бюджет градиента: доля исходного сигнала SFT, которую нужно оставить. Бюджет выбирают для каждого домена по отложенной выборке, а порог рассчитывают отдельно для каждой траектории. Цели зависят только от демонстраций и вероятностей базовой модели, поэтому их можно подготовить заранее без вероятностей от модели-учителя и без новых запусков среды.

Метод проверяли на Qwen2.5-1.5B-Instruct, Qwen2.5-7B и Qwen3-8B. В обучение вошли 36 000 траекторий по математике, коду, естественным наукам и общим задачам, а также 8 252 траектории для клиентских сценариев, программирования, поиска и работы с инструментами. SoFT сравнивали с базовой моделью, обычным SFT и несколькими методами отбора, взвешивания и регуляризации обучающих сигналов при одинаковых данных и вычислительном бюджете.

Мягкие цели дали более ровный результат

SoFT улучшил относительно базовой модели 22 из 24 оценок на отдельных бенчмарках и показал лучшее среднее геометрическое во всех конфигурациях. Этот совокупный показатель сильнее реагирует на провал в одном домене, чем обычное среднее, поэтому его труднее поднять за счёт одной удачной группы задач.

Самая заметная деталь появилась в агентском бенчмарке τ2 на задачах вне обучающего распределения: результат вырос с 20,67 до 48,33. Обычный SFT при этом лучше решал отдельные задачи по коду и работе в терминале, но сильнее ухудшал клиентские сценарии и вызов инструментов. SoFT не победил на каждом бенчмарке, зато избежал крупных потерь в соседних доменах.

Распределение ответов после SoFT отклонилось от базовой модели примерно на одну десятую от отклонения после SFT. Более сильное копирование демонстраций само по себе не объясняло качество: методы, которые заметнее повышали вероятность токенов учителя, иногда получали худший совокупный результат.

Когда SoFT стоит добавить в план обучения

Работа меняет планы прежде всего для команд, которые объединяют демонстрации от разных учителей и доменов в одной модели. В таком наборе обычный SFT может улучшить код или математику и одновременно испортить вызов инструментов, общие ответы либо перенос на новые задачи. SoFT даёт явный регулятор этого обмена вместо единого жёсткого режима для всех токенов.

В существующий процесс не нужно добавлять онлайн-обучение или обращаться к модели-учителю за полным распределением вероятностей. Потребуется один раз прогнать демонстрации через базовую модель, сохранить нужные вероятности и заменить однозначные цели в функции потерь мягкими. Для экономии памяти работа также описывает приближение, которое хранит только несколько наиболее вероятных токенов.

Главная дополнительная настройка — бюджет градиента для каждого домена. Его выбирали по отложенным примерам, поэтому SoFT не устраняет настройку гиперпараметров, а делает её более содержательной: бюджет прямо показывает, насколько команда готова отойти от поведения базовой модели ради нового навыка.

Практический пилот стоит проводить рядом с текущим SFT на тех же данных и вычислительном бюджете. В оценку следует включить не только задачи из обучающего набора, но и сохранение исходных навыков на соседних бенчмарках. Выводы работы пока относятся к моделям Qwen, смешанным задачам рассуждения и агентским траекториям; последующее обучение с подкреплением в эксперименты не входило.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу