Журнал · Rit.work

MT-SDPO собирает одну LLM из нескольких доменных учителей

Авторы MT-SDPO предлагают выбирать учителя для каждого задания по проверенному ответу и после обучения разворачивать только одну модель-ученика.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Xixiang He и соавторы представили MT-SDPO — способ объединить знания нескольких доменных LLM в одной модели-ученике. В препринте, который не проходил рецензирования, авторы измерили рост точности Qwen3-8B в её слабейшем домене на 14,79 процентного пункта. Работа важна командам, которым нужна одна развёртываемая модель вместо маршрутизации запросов между несколькими специализированными моделями.

Что сделали

MT-SDPO обучает ученика на его собственных ответах, а замороженные модели-учителя использует как дополнительные источники обратной связи. Перед обучением каждый учитель отдельно отвечает на каждое задание. Программный проверяющий модуль сопоставляет ответ с эталоном и допускает учителя к конкретному заданию только при правильном результате — независимо от заявленной специализации.

Во время обучения правильный ответ самого ученика становится опорным примером для его ошибочных вариантов. Если ученик ошибся, допущенные учителя разбирают ответ; их замечания объединяются в скрытый контекст для усреднённой по шагам копии ученика. Эта копия задаёт распределение вероятностей токенов, которому учится основная модель. После обучения проверяющий модуль, учителя и вспомогательная копия отбрасываются.

По замерам авторов, выбор учителя по домену находил правильный источник для 52,94% заданий, а проверка всех учителей для каждого примера подняла покрытие до 65,69%. Для Qwen3-8B разрыв точности между лучшим и худшим доменами сократился с 20,96 до 5,30 процентного пункта.

Что это значит

Подход меняет архитектуру внедрения: несколько специализированных моделей нужны при подготовке и обучении, но на этапе эксплуатации остаётся одна политика. Практическая предпосылка — наличие эталонного ответа и надёжной автоматической проверки. Без них правило допуска учителей нельзя перенести напрямую.

Ограничения. Авторы проверяли метод на пяти учениках из трёх семейств и только на заданиях по химии, материаловедению и физике из SciKnowEval L3. Для Llama-3.1-8B-Instruct улучшения после многодоменного обучения не получили. Проверка подтверждает один сохранённый ответ учителя, но не корректность его последующего разбора; лексический фильтр также не гарантирует отсутствие смысловых ошибок. Работа не показывает перенос на задачи без точного эталона и не сравнивает стоимость или задержку обучения и эксплуатации.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу