Журнал · Rit.work

DecSteer добавляет навыки модели без обучения с подкреплением

DecSteer обучает компактный оператор прямого ответа на готовых примерах и сокращает вычисления, не меняя веса базовой языковой модели.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Навык прямого ответа можно добавить к языковой модели без обучения с подкреплением и без изменения её основных весов. В препринте Ran Li и Lei Chen, который не проходил рецензирование и приводит их собственные замеры, DecSteer с 23 тысячами параметров сравнялся с оператором на 1,33 миллиона параметров и ускорил ответы LiveMath в 36 раз. Это делает отдельные сменные навыки реалистичной альтернативой полной донастройке модели.

Как навык встраивают в замороженную модель

DecSteer не записывает новые знания в базовую модель. Он подключает небольшой оператор к скрытым представлениям на нескольких глубинах декодера и добавляет к ним поправку перед следующим слоем.

Оператор сначала нормализует скрытое представление, затем сжимает его до пространства малого ранга, преобразует и разворачивает обратно. Ранг здесь задаёт ширину узкого промежуточного представления: чем он ниже, тем меньше обучаемых параметров. Одна и та же основа работает на всех выбранных глубинах, а отдельные управляющие коэффициенты регулируют силу поправки.

До обучения оператор должен вести себя как точное тождественное преобразование, чтобы не повредить исходную модель. DecSteer обнуляет последнюю проекцию: поправка сначала равна нулю, но сама проекция получает градиент уже на первом шаге.

У KV-Skill, с которым сравнивают новый метод, обнулена внутренняя матрица. Из-за этого градиент сначала не достигает двух крупных матриц оператора. Одинаковый сигнал копирования поведения почти не меняет KV-Skill, тогда как архитектура DecSteer сразу открывает путь для обучения.

Функцию потерь считают только по токенам правильного ответа. Для LiveMath хватило 35 эталонных примеров, а обучение заняло 12 минут на одном GPU. Не нужны генерация пробных ответов, отдельная модель проверки и опорная политика, которые требуются при обучении с подкреплением.

Оператор усиливает готовый ответ, а не сжимает рассуждение

В полной конфигурации DecSteer набрал 80,9 на LiveMath против 79,0 у лучшего опубликованного варианта KV-Skill. Короткий ответ не ухудшил точность: модель перестала выводить длинную цепочку рассуждений, но чаще выбирала правильный результат.

Проверка оценок токенов по слоям показала, что оператор не записывает ответ в ранние слои. Он усиливает уже существующий путь к ответу ближе к выходу модели. В части примеров базовая модель не находила верное решение даже при нескольких независимых генерациях, а оператор менял итоговый выбор — поэтому результат нельзя объяснить одним удалением лишнего текста.

Навык сохранился и на задачах LiveMath, выпущенных через несколько месяцев после обучающей части. На новых примерах результат составил 79,0 против 25,4 у базовой модели и оказался на 7,5 пункта выше официального оператора KV-Skill. Это проверяет перенос на новые вопросы внутри той же задачи, но не перенос на другой тип работы.

Метод проверяли на LiveMath, SearchQA, CommonsenseQA, OpenBookQA и DocVQA с базовыми моделями семейств Qwen и Llama. Сравнение охватывает математические ответы, поиск короткого факта, тесты на знания и вопросы по документам. Использовали те же разбиения, подсказки, правила декодирования и оценщики, что и KV-Skill; самые сильные результаты этого соперника взяты из опубликованных замеров, а полностью одинаковый протокол воспроизвели на меньших базовых моделях.

Когда DecSteer меняет планы разработки

Работа меняет планы команд, которые контролируют модель и контур выполнения запросов. Если продукту нужен набор узких режимов — извлечение ответа, выбор метки, переход от рассуждения к короткому результату, — сначала стоит проверить небольшой оператор на эталонных ответах. Обучение с подкреплением и полная донастройка перестают быть обязательным первым шагом.

Практический критерий — запас качества базовой модели. DecSteer лучше всего работает там, где модель уже содержит нужный навык, но не выбирает правильный ответ при обычном декодировании. На задачах, где базовая модель почти достигла потолка, оператор не добавлял заметной точности; его польза там сводилась к более короткой генерации.

Такой подход не заменяет рассуждение, если промежуточные шаги сами несут нужную информацию или должны попасть в результат. Он также привязан к ширине и глубине базовой модели, поэтому при смене архитектуры оператор обучают заново.

Обученные навыки можно менять между запросами, складывать и плавно смешивать с положительными коэффициентами. Авторы отдельно обнаружили опасную границу: вычитание навыка, который переключает модель из длинного рассуждения в прямой ответ, разрушает качество. Библиотека операторов поэтому требует правил совместимости, а не только хранилища файлов.

Главный инженерный вывод состоит не в том, что рассуждение больше не нужно. DecSteer показывает более дешёвый путь для случаев, когда решение уже скрыто в базовой модели: небольшой обучаемый модуль может направить её к этому решению без отдельного контура обучения с подкреплением.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу