Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модели после обучения с подкреплением научились дообучать на новых задачах так, чтобы они почти не теряли способность рассуждать. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, NB-LoRA сохранил среднюю точность рассуждений на уровне 67,1% против исходных 67,7%. Команда может менять знания или стиль ответов модели без повторного обучения с подкреплением и без постоянного подмешивания старых задач.
Как обновление уводят от рассуждений
Обычный LoRA замораживает исходную модель и добавляет к линейным слоям матрицы низкого ранга. Их параметры можно обучить дёшево по сравнению с обновлением всей модели, но ничто не мешает этим матрицам изменить те же внутренние представления, на которых держатся рассуждения.
NB-LoRA сначала пропускает через исходную модель набор задач на рассуждение и сохраняет входные скрытые состояния для каждого изменяемого слоя. Из них строят матрицу H. Если обновление весов ΔW удовлетворяет условию HΔWᵀ = 0, выход слоя на сохранённых состояниях не меняется.
Для этого не нужно проверять ограничение на каждом шаге. Метод находит направления, в которых скрытые состояния почти не меняются, и собирает из них фиксированный базис Ns. Авторы оставляют главные направления, содержащие 99% спектральной энергии, а остальные считают приближённым нуль-пространством.
Обновление LoRA записывают как ΔW = BCNsᵀ. Матрицы B и C обучаются, а Ns остаётся замороженной. Поэтому любое обновление проходит только через выбранное пространство и почти не затрагивает состояния, собранные на задачах рассуждения.
Базис вычисляют один раз до дообучения. Для проекций запросов, ключей и значений в одном блоке можно повторно использовать одни и те же скрытые состояния. Сходство полученных пространств в большинстве слоёв стабилизировалось после 512 примеров, поэтому для построения ограничения не понадобился полный набор данных обучения с подкреплением.
Рассуждения сохранились и на незнакомых тестах
На целевых задачах NB-LoRA показал примерно ту же точность, что и обычный LoRA. Разница проявилась после дообучения: обычный адаптер мог перезаписать поведение, сформированное обучением с подкреплением, тогда как ограниченный адаптер оставлял результаты рядом с исходной моделью.
Проверка охватывала Qwen2.5-3B и Qwen2.5-1.5B. Их обучили с подкреплением через GRPO на MATH-lighteval и GSM8K, затем адаптировали к задачам на здравый смысл и использованию инструментов. Сохранение рассуждений измеряли как на исходных наборах, так и на MATH-500, AGIEval-EN-MATH и MMLU-STEM, которые не участвовали в построении базиса.
Для Qwen2.5-3B средняя точность на проверках рассуждений составила 67,1% после адаптации против 67,7% до неё. Сходный результат получился на меньшей модели: NB-LoRA удержал качество и за пределами набора, по которому вычисляли ограничение. Это указывает, что базис защищает общие внутренние представления, а не только ответы на сохранённые примеры.
По сравнению с NSCL, который проецирует обновления всей модели на каждом шаге оптимизатора, NB-LoRA обучался в 6,3 раза быстрее и использовал в 2,1 раза меньше пиковой памяти GPU на Qwen2.5-3B. Причина в устройстве метода: фиксированный базис заменяет повторные проекции и полные состояния оптимизатора.
В дополнительной проверке качество удерживалось, когда базис оценивали начиная с 64 примеров. При меньшем наборе результат ухудшался, особенно на более крупной модели. Значит, случайной горсти задач недостаточно: набор должен покрывать типичные траектории рассуждения, которые команда хочет сохранить.
Когда NB-LoRA меняет план дообучения
Метод относится к конкретному сценарию: есть модель после обучения с подкреплением, а затем её нужно дообучить с учителем на новых знаниях, формате ответа или использовании инструментов. Если стандартный LoRA уже входит в процесс, NB-LoRA меняет прежде всего подготовительный этап: перед адаптацией нужно собрать скрытые состояния и вычислить базисы для выбранных линейных слоёв.
Это требует доступа к внутренним состояниям модели, её слоям и процессу обучения адаптера. Вычисление базиса добавляет отдельную офлайн-операцию и требует хранить замороженные матрицы для слоёв, зато во время обучения не нужны старые примеры в каждом пакете и проекция градиентов после каждого шага.
Выбор модулей влияет на итог. Настройка только проекций внимания недообучала модель на новых задачах, а добавление линейных слоёв блока прямого распространения закрывало большую часть разрыва. Команде придётся выбирать между объёмом базисов, стоимостью адаптации и полнотой охвата слоёв, а не просто заменять класс LoRA-адаптера.
Работа пока подтверждает подход только на двух моделях семейства Qwen небольшого масштаба, математических рассуждениях, задачах на здравый смысл и использовании инструментов. Эти условия подходят для технического прототипа, но не доказывают, что тот же базис сохранит сложное поведение у более крупных моделей или после длинной цепочки разнородных дообучений.
Практический план выглядит так: сохранить обычный LoRA как контрольный вариант, построить NB-LoRA на репрезентативных задачах рассуждения и сравнить не только целевую точность, но и исходные способности модели. Если обычный адаптер вызывает забывание, фиксированное нуль-пространство даёт способ ограничить обновления без возврата к дорогому обучению всей модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



