Журнал · Rit.work

Как отбор данных по Фишеру сокращает бюджет продолженного предобучения

Отбор документов по влиянию на параметры модели позволил превзойти повторное обучение на общих данных при в десять раз меньшем токен-бюджете.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель удалось дообучить на медицинских текстах так, чтобы она лучше освоила новый домен и меньше растеряла прежние навыки. В нерецензированном препринте University of Illinois Chicago и Cisco Research, где все числа получили сами авторы, 1 млрд отобранных токенов обошёл 10 млрд токенов с повторным подмешиванием общих данных. Для команд это повод считать бюджет не только после фильтрации корпуса: выбор документов может заменить значительную часть дорогого повторения.

Как градиент документа показывает риск забывания

Продолженное предобучение дообучает готовую LLM на неразмеченных текстах из нового домена. Оно помогает освоить медицинскую, финансовую или другую специализированную лексику, но обновления параметров могут повредить навыки, которые уже содержались в исходной модели.

Обычные фильтры оценивают качество текста, его соответствие теме или перплексию — насколько неожиданным документ оказался для модели. Такой показатель описывает документ одним числом, но не показывает, какие параметры сдвинет обучение на нём. Два текста с одинаковой перплексией могут по-разному влиять на прежние навыки.

Метод использует информацию Фишера, которая показывает чувствительность поведения модели к изменению каждого параметра. Большое значение означает, что даже небольшой сдвиг соответствующего параметра заметно меняет ответы модели. Малое значение указывает на направление, где модель пока менее связана прежним обучением.

Для каждого документа вычисляют градиент потерь и строят два его представления. Якорная часть усиливает направления с высокой информацией Фишера и показывает связь обновления с уже закреплённым поведением. Пограничная часть усиливает менее занятые направления, через которые можно добавить новые знания с меньшим вмешательством в старые.

Селектор учитывает обе части одновременно. Если оставить только якорную, адаптация почти останавливается; если убрать её и смотреть лишь на свободные направления, модель забывает больше. Замена информации Фишера обычной нормой градиента тоже ухудшает сочетание адаптации и сохранения навыков.

Почему лучший документ не образует лучший набор

Ранжировать документы по отдельности недостаточно. Несколько высоко оценённых текстов могут вызывать почти одинаковые обновления параметров: обучение потратит токены на повторение одного направления и не покроет другие части домена.

Поэтому метод оценивает весь выбранный набор через логарифм определителя матрицы градиентов. Он растёт, когда документы добавляют независимые направления обновления, и почти не меняется, когда очередной документ повторяет уже выбранные. Так селектор одновременно учитывает влияние на прежние навыки, возможность выучить новое и отсутствие повторов.

У такой целевой функции действует правило убывающей отдачи: ценность документа снижается, если похожие градиенты уже попали в набор. Это позволяет применять Sieve-Streaming — потоковый алгоритм, который один раз проходит по корпусу и держит несколько вариантов набора с разными порогами принятия. Его затраты на очередной документ не растут вместе с размером всего корпуса.

Полный расчёт по всем параметрам LLM был бы непрактичен. Конвейер сначала немного дообучает LoRA-адаптер на целевом домене, затем оценивает диагональ информации Фишера на небольшом опорном наборе. Градиенты считают только в пространстве LoRA, сжимают случайной проекцией и уже после этого передают потоковому селектору.

Это не бесплатный фильтр перед обучением: для каждого кандидата нужен градиент, а не только прямой проход модели. Зато корпус не приходится целиком хранить в памяти или многократно перебирать ради жадного отбора.

Когда результат меняет план обучения

Метод проверяли на TinyLlama-1.1B и Llama-3.1-8B при дообучении на медицинском корпусе PMC/PubMed. Адаптацию измеряли на медицинских задачах, а забывание — по падению результатов на отложенных общих тестах. Сравнение включало случайный отбор, фильтрацию по перплексии, регуляризацию EWC и повторное подмешивание общих данных.

На меньшей модели выбранный миллиард токенов превзошёл десятимиллиардный вариант с повторением общих данных и по освоению медицинского домена, и по сохранению прежних навыков. На большей модели селектор также дал лучшую адаптацию и наименьшее забывание среди сравненных способов продолженного предобучения.

Работа меняет план для команд, которые владеют весами модели, собирают крупный доменный корпус и собирались защищаться от забывания главным образом повторным обучением на общих текстах. Отбор стоит вынести в отдельный этап конвейера, а бюджет сравнивать по полным затратам: расчёт градиентов, построение селектора и последующее обучение.

Для модели, доступной только через внешний API, метод неприменим: ему нужны параметры, градиенты и возможность обучать LoRA. Доказательства пока охватывают один домен, две модели, диагональное приближение информации Фишера и обучение адаптеров. Перед заменой повторения нужен пилот с двумя наборами проверок — на целевые навыки и на возможности исходной модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу