Журнал · Rit.work

TaRA подбирает инициализацию LoRA по динамике полного обучения

Авторы TaRA предлагают учитывать активации и градиенты при инициализации LoRA, чтобы приблизить её траекторию обучения к полному дообучению модели.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи POSTECH Taehyeon Kim и Eunhyeok Park предложили TaRA — способ инициализации LoRA перед дообучением языковой модели; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, TaRA показала лучший средний результат, чем исходная LoRA и три альтернативных способа инициализации, при всех исследованных рангах адаптера. Работа важна командам, которые дообучают модели под собственные данные и выбирают между снижением затрат на обучение и качеством полного обновления весов.

Что сделали

LoRA сокращает число обучаемых параметров: исходные веса модели замораживаются, а их обновление представляется произведением двух небольших матриц. Размер внутреннего измерения этих матриц называют рангом. Чем он меньше, тем жёстче ограничение на направления, в которых веса могут меняться.

В исходной LoRA одна матрица заполняется случайными значениями, а другая — нулями. Последующие методы пытаются выбрать более содержательную начальную точку. PiSSA сохраняет главные компоненты исходных весов, CorDA дополнительно учитывает статистику входных активаций, а LoRA-One ориентируется на градиент — направление изменения весов, которое уменьшает ошибку на обучающих данных.

Авторы TaRA считают, что этих сигналов по отдельности недостаточно. Главные компоненты весов описывают устройство модели, но не обязательно важны для текущей задачи. Градиент показывает ближайшее направление обновления, но не учитывает, как чувствительность функции различается между направлениями пространства параметров.

TaRA совместно использует исходные веса, ковариацию активаций и ковариацию градиентов. Ковариация здесь показывает, какие направления сигнала меняются согласованно и сильнее влияют на локальную динамику обучения. Статистику собирают на калибровочных данных за прямой и обратный проход, после чего выполняют сингулярное разложение матрицы, взвешенной этими ковариациями. Из ведущих компонентов формируются две матрицы LoRA.

Замороженный остаток исходных весов корректируется так, чтобы после инициализации модель выдавала ту же функцию, что и до добавления адаптера. Поэтому TaRA меняет стартовую геометрию обучения, а не исходное поведение модели. Математическое обоснование опирается на локальное приближение кривизны функции потерь через информацию Фишера и её факторизацию по активациям и градиентам.

Что показали

На задачах математических рассуждений и генерации кода TaRA лидировала по среднему результату при каждом проверенном ранге. При минимальном ранге среднее составило 29,33 против 28,35 у ближайшего конкурента LoRA-One. При максимальном ранге TaRA получила 32,98 против 32,13 у CorDA. Преимущество сохранялось при изменении доступной ёмкости адаптера, но в абсолютных значениях оставалось умеренным.

Авторы также измерили сходство градиента адаптера с градиентом полного обновления весов. TaRA сохраняла лучшее выравнивание не только сразу после инициализации, но и по ходу обучения. Это согласуется с основной гипотезой работы: удачная начальная подпространственная структура влияет на всю последующую траекторию, а не только на первые обновления.

Сбор статистики и разложение увеличили общее время двух показанных запусков на 4–5%. После обучения адаптер по-прежнему можно объединить с базовыми весами, поэтому метод не добавляет вычислений при получении ответов модели.

Ограничения

Для генеративных задач метод проверяли на LLaMA-2-7B, обученной отдельно на MetaMathQA и CodeFeedback-Filtered-Instruction объёмом по сто тысяч примеров. Для задач понимания языка использовали DeepSeek-R1-Distill-Qwen-1.5B, LLaMA-2-7B, LLaMA-3.1-8B и Qwen-3-8B. Калибровочная выборка состояла из 256 примеров. Работа не показывает, переносится ли результат на более крупные модели, другие архитектуры и производственные наборы данных.

TaRA зависит от соответствия калибровочных данных будущему обучению. Авторы отмечают менее устойчивые результаты на HumanEval и MBPP, которые отличаются по распределению от данных CodeFeedback. Следовательно, метод нельзя считать подтверждённым решением для сценария, где калибровочная выборка плохо описывает целевые запросы.

По сравнению с обычной LoRA и PiSSA требуется дополнительный доступ к данным, обратный проход и хранение ковариаций. В работе изучено снижение точности вычислений, но в приведённом сравнении нет численной оценки пиковой памяти. Также не измерены стоимость инженерного внедрения и чувствительность к смене домена после запуска.

Что это значит

Работа не требует менять базовую модель, формат адаптеров или схему развёртывания. Если команда уже использует LoRA, TaRA можно рассматривать как замену этапа инициализации: обучение и последующее объединение адаптера с весами остаются прежними.

Планы стоит пересмотреть командам, для которых качество LoRA уже стало ограничением, а полное дообучение не помещается в доступный бюджет GPU. Результаты авторов указывают, что часть разрыва можно сократить выбором стартового подпространства, не увеличивая ранг. Практический кандидат на проверку — стабильный домен с репрезентативными калибровочными примерами, где дополнительный обратный проход и память допустимы.

Менять утверждённую систему обучения только на основании этой работы рано. Преимущество над сильными способами инициализации измеряется несколькими долями или единицами среднего балла и зависит от задачи. Рациональный следующий шаг — параллельный запуск TaRA и текущей LoRA на собственном наборе проверки с фиксацией качества, времени и пиковой памяти. Если данные часто меняются или калибровочная выборка не соответствует эксплуатации, заявленное преимущество может не сохраниться.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу