Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Специализированные языковые агенты научились объединять знания из разных областей без прежнего падения качества. В препринте, который не прошёл рецензирование и содержит замеры самих авторов, метод USA превысил результат обучения на одной области в среднем более чем на четыре пункта. Подход позволяет развивать специалистов раздельно, а затем сливать их параметры.
Авторы рассматривают дистилляцию на траекториях ученика: модель решает многошаговую задачу, а более крупный учитель подсказывает правильное распределение вероятностей для каждого созданного токена. Обучение только на одной области быстро упирается в потолок. Совместная смесь задач добавляет новые способы рассуждения, но сигналы от разных областей могут мешать друг другу.
Альтернатива — обучить каждого специалиста от общей исходной модели и сложить получившиеся изменения параметров. Однако математика и естественные науки обновляли часть одних и тех же параметров сопоставимо сильно. Из-за этого весовое усреднение и ещё три проверенных способа слияния уступили специалисту, обученному только на целевой области.
USA измеряет изменения каждого параметра после короткого разогрева. Затем метод сильнее сглаживает функцию потерь вокруг параметров, которые изменились заметнее остальных: при последующем слиянии они должны выдерживать большее смещение. В отличие от обычной минимизации резкости, USA распределяет допустимое возмущение не одинаково, а по масштабу ранних обновлений.
Метод проверили на двух размерах Qwen3, задачах по математике, естественным наукам и программированию. Для каждой области использовали по четыре тысячи учебных примеров, а перенос оценили во всех шести направлениях между парами областей. USA показал лучший результат в каждом направлении и снизил среднее пересечение обновляемых параметров у конфликтующей пары на 46%. Эти выводы относятся к моделям с общей исходной точкой, которые объединяют через изменения весов.
Источники
Иллюстрация: рисунок из статьи «USA: Update-aware SAM for Cross-domain On-Policy Disitllation of Language Agents», Qiyong Zhong, Mao Zheng, Mingyang Song и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



