Журнал · Rit.work

DKL предлагает добавлять знания в LLM через слияние весов

Авторы DKL обучают доменные знания на базовой LLM и переносят их в модель, настроенную на инструкции, чтобы поддержать RAG при ошибках поиска.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи IBM и Indian Institute of Technology Madras предложили DKL — способ добавлять знания из предметного корпуса в модель, настроенную на инструкции; работа опубликована как препринт, который не проходил рецензирование. По замерам авторов, при ошибке поиска доля правильных ответов RAG выросла с 54,17% до 79,26%. Метод важен командам, которые используют открытые веса и хотят сделать систему менее зависимой от качества поиска по документам.

Что сделали

DKL разделяет обучение знаниям и обучение следованию инструкциям. Авторы исходят из того, что базовая LLM приспособлена к продолжению текста, а модель, настроенная на инструкции, дополнительно обучена отвечать на запросы и соблюдать формат диалога. Если продолжить предварительное обучение второй модели на документах, она может забыть часть приобретённых навыков.

Поэтому расширенное предварительное обучение проводят на базовой версии LLM. Модель читает новый корпус и учится предсказывать следующий токен. Изменение её весов сохраняют как адаптер знаний, после чего добавляют этот адаптер к весам соответствующей модели, настроенной на инструкции. Коэффициент слияния подбирают отдельно.

Такой подход требует пары совместимых контрольных точек: базовой и полученной из неё модели для инструкций. Повторное обучение на исходном наборе инструкций не нужно. Это существенно для моделей, у которых опубликованы веса, но недоступен набор данных, использованный при настройке поведения.

Авторы также заменяют при обучении адаптера токеновые представления базовой модели на представления из версии для инструкций. Это снижает рассогласование специальных токенов и формата чата: адаптер обучается на базовой модели, но заранее видит словарь среды, в которой будет работать после слияния.

К корпусу можно добавить небольшой набор синтетических пар «вопрос — ответ». Они используются не как обычный набор инструкций, а как дополнительный текст для предварительного обучения. Их задача — облегчить извлечение уже усвоенных сведений, а не покрыть вопросами каждый фрагмент документации.

Что показали

Качество оценивали по доле ответов, которые модель-оценщик признала не хуже эталонного ответа. В режиме без найденных фрагментов DKL проверяет, может ли модель ответить за счёт знаний в собственных параметрах; в режиме RAG к запросу добавляют результаты поиска.

На техническом корпусе доля принятых ответов без поиска составила 73,80% для DKL против 64,22% для PA-RAG. В экспериментах метод также опередил RAFT и Chat-Vector, хотя величина разрыва зависела от модели, набора данных и режима оценки.

Синтетические вопросы для DKL занимали 50% от объёма исходного корпуса. Для RAFT авторы подготовили материал объёмом вдвое больше корпуса, а для PA-RAG — примерно в десять раз больше из-за нескольких вариантов ответа на каждый вопрос. Абляция, то есть проверка отдельных компонентов метода, показала, что замена токеновых представлений помогает именно при сбоях поиска.

Ограничения

Авторы называют два практических ограничения. DKL требует доступной базовой модели, из которой получена версия для инструкций. Кроме того, коэффициент слияния и подходящую контрольную точку приходится искать экспериментально; автоматического способа выбрать их в работе нет.

Метод проверяли на двух технических IBM Redbooks и небольшой выборке длинных текстов QuALITY. Эксперименты охватывают несколько семейств открытых моделей размером от 0,6 до 8 млрд параметров. Это не показывает, как DKL ведёт себя на более крупных моделях, закрытых API, мультиязычных корпоративных корпусах или после нескольких последовательных обновлений знаний.

Основную оценку выполняла другая LLM, а согласование с людьми авторы проверяли в небольшом отдельном исследовании. Сравнение с RAFT, PA-RAG и Chat-Vector не включает стоимость генерации данных в деньгах, потребление GPU, задержку итоговой модели и расходы на регулярное обновление корпуса. Поэтому по работе нельзя рассчитать совокупную стоимость производственной системы.

Что это значит

Работа не даёт оснований заменять существующий RAG. Она предлагает дополнительный слой защиты: если поиск вернул неполный или неверный контекст, модель может опереться на знания, записанные в её параметрах. При успешном поиске RAG по-прежнему связывает ответ с актуальным документом, тогда как обновление параметров требует нового обучения и слияния.

Планы стоит менять только командам, у которых доступны совместимые базовая и настроенная на инструкции версии модели. Для них DKL имеет смысл добавить в технический эксперимент рядом с текущим RAG и проверить на собственных сбоях поиска, не ухудшились ли общие инструкции, формат ответов и работа с неизвестными вопросами.

Если продукт использует только закрытый API, метод неприменим: он требует доступа к весам и обучения адаптера. Если знания часто меняются, сначала следует сопоставить стоимость повторного обучения и подбора коэффициента с более простым улучшением разбиения документов, поиска и ранжирования. Главный результат работы — не замена поиска параметрической памятью, а возможность обучать эту память отдельно от поведения модели.

Источники

Иллюстрация: рисунок из статьи «DKL: Decoupled Knowledge Learning for Instruction-Tuned Language Models», Kushagra Bhushan, Meghanadh Pulivarthi, Sai Krishna Reddy Sathi и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу