Журнал · Rit.work

LS-LoRA выбирает слои дообучения, чтобы модель меньше забывала

LS-LoRA ставит адаптеры только в чувствительные к задаче слои и лучше сохраняет общие способности модели, чем LoRA во всех слоях.

Rit.work
Студия разработки
9 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM можно дообучать под математику и код, меньше повреждая навыки здравого смысла. В работе Xi’an Jiaotong University метод LS-LoRA обошёл обычный LoRA и по целевым задачам, и по сохранению общих способностей, хотя препринт не рецензирован, а числа получили сами авторы. Для команд это превращает выбор слоёв из внутренней детали архитектуры в отдельный этап настройки.

Почему место адаптера влияет на забывание

Обычный LoRA добавляет обучаемые низкоранговые адаптеры в каждый слой Transformer, а исходные веса оставляет замороженными. Такой подход сокращает объём обучаемых параметров, но сам по себе не гарантирует, что модель сохранит способности, полученные при предварительном обучении.

Эксперимент с отдельным дообучением каждого слоя показал, что слои ведут себя по-разному. Изменение одних заметно улучшает целевую задачу, тогда как изменение других сильнее снижает точность на проверках здравого смысла. Значит, одинаково распределять адаптеры по всей модели необязательно.

Чтобы измерить чувствительность слоя к задаче, исследователи использовали эмпирическую информацию Фишера. Для каждого параметра они вычисляли квадрат градиента правдоподобия правильного ответа, а затем усредняли значения внутри слоя. Высокий результат означает, что небольшое изменение параметров этого слоя сильнее меняет ответы модели на целевых данных.

Такой расчёт требует размеченных ответов и обратного прохода через модель. На крупных LLM он расходует память и вычисления ещё до начала самого дообучения, поэтому для практического отбора слоёв нужен более дешёвый признак.

Как выбрать слои одним прямым проходом

Вместо градиентов LS-LoRA сравнивает представление токена до слоя и после него. Косинусное сходство показывает, насколько совпадают направления двух векторов: низкое значение означает, что слой сильнее преобразовал входное представление. Такие слои в экспериментах чаще получали высокую оценку по информации Фишера; связь оказалась статистически значимой на всех проверенных сочетаниях моделей и задач.

  1. Из обучающего набора случайно берут 100 входов. Правильные ответы для отбора не нужны.
  2. Модель выполняет один прямой проход. Для каждого слоя сохраняют представления последнего токена без заполнителя до блока и после него.
  3. Для каждого слоя усредняют косинусное сходство по калибровочным входам.
  4. В слои со значением ниже 0,85 ставят адаптеры LoRA. Выбранный набор больше не меняют.
  5. Исходные веса замораживают и обучают только добавленные адаптеры на обычной целевой функции задачи.

Проверка охватила Llama-3.2-1B, Llama-3.2-3B, Llama-3-8B и Mistral-7B. Модели дообучали на математических задачах MATH-10K и данных для генерации кода Magicoder-Evol, а затем оценивали на GSM8K, AQuA, SVAMP и HumanEval+. Сохранение общих способностей измеряли только тремя наборами на здравый смысл — ARC-Challenge, OpenBookQA и Social IQA, поэтому результат не описывает все возможные навыки LLM.

Что меняется в плане дообучения

На математике LS-LoRA превысил обычный LoRA по средней точности целевых задач на 0,4–1,1 процентного пункта. Разница в средней точности на проверках здравого смысла составила 6,0–14,3 пункта. Метод выиграл по обоим средним показателям на каждой проверенной модели.

На генерации кода LS-LoRA также показал лучший средний результат среди сопоставленных способов дообучения и лучше сохранил здравый смысл. Случайный выбор того же количества слоёв уступил отбору по сходству, поэтому эффект объясняется не только сокращением числа адаптеров.

Избирательное размещение адаптеров заодно уменьшило расход памяти и ускорило обучение на математических данных: максимальное сокращение времени достигло 29,6%. Тот же принцип сработал с DoRA и PiSSA, то есть критерий не привязан только к LoRA.

Команде с готовым конвейером LoRA не требуется менять обучающие данные или добавлять штраф к целевой функции. Перед обучением появляется калибровочный проход, после которого адаптеры устанавливают только в выбранные блоки. Это небольшое изменение конвейера по сравнению с повторным обучением на общих данных или настройкой ограничений для весов.

Порог из работы стоит считать исходной настройкой, а не универсальной константой: оценки слоёв зависят от целевой задачи. Перед заменой обычного LoRA нужно сравнить оба варианта на собственных целевых и общих тестах. Главный практический вывод работы — бюджет адаптеров следует распределять не только между модулями, но и между слоями.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу