Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Вклад каждого обучающего примера в заданное поведение модели научились считать до следующего обновления параметров — и сразу менять ход обучения. В препринте Rice University, который не проходил рецензирование и содержит замеры самого автора, такое управление снизило число ответов, которые модель-оценщик сочла вредными, с 84 из 200 до 2 из 200 на промежуточной точке обучения. Контроль поведения переносится из разбора готовой модели внутрь тренировочного цикла.
Как отделяют вклад примера от влияния всего пакета
Метод начинает с измеримого целевого поведения. Это может быть набор потерь на контрольных ответах или многомерный показатель свойства модели: например, насколько её ответы соответствуют заданной персоне. Показатель должен быть дифференцируемым, чтобы проследить его изменение через обновление параметров.
Для каждого примера метод оценивает, как небольшое изменение его веса сдвинет целевое поведение после очередного шага оптимизатора. Расчёт учитывает не только градиент потерь, но и фактическую механику AdamW: накопленные моменты, адаптивный масштаб и ограничение градиента.
Одной величины сдвига недостаточно. Несколько примеров в пакете могут менять поведение почти одинаково, поэтому по итоговому сдвигу трудно понять, какой из них сработал. Показатель BGU уменьшает оценку для направлений, которые уже создают другие примеры, и сохраняет её для отличимого вклада.
Авторы связывают BGU с взаимной информацией — количеством сведений о вкладе отдельного примера, которое остаётся в общем изменении поведения. Связь логарифмическая: особенно большие значения влияют на итоговую оценку слабее. Затем оценка получает знак по направлению сдвига и показывает, усиливает пример целевое свойство или ослабляет его.
Знак зависит от текущего состояния модели и оптимизатора. Один и тот же текст при другом порядке данных может действовать в противоположную сторону, поэтому один раз присвоить примеру постоянную полезность нельзя. Оценку приходится обновлять по ходу обучения.
Как расчёт помещается между двумя обновлениями
Прямой подход потребовал бы отдельно строить для каждого примера градиент размером со всю модель. Алгоритм BS-Ghost вместо этого один раз рассчитывает действие оптимизатора, а затем получает вклады примеров из активаций и ошибок, которые уже возникли при прямом и обратном проходах. Полные индивидуальные градиенты хранить не нужно.
Ответы модели по разным координатам поведения обрабатываются частями. Алгоритм сворачивает их в матрицу размером с пакет и решает одну систему уравнений сразу для всех примеров. Производные целевого поведения разрешается повторно использовать несколько шагов, пока градиенты примеров и состояние оптимизатора обновляются на каждом шаге.
На полном прогоне Qwen2.5-7B-Instruct BS-Ghost добавил 8% к времени обычного обучения. В экспериментах с изменением весов средний косинус между предсказанным и фактическим направлением сдвига составил 0,84, где единица означает полное совпадение направлений.
Контроллер уменьшал вес примеров, которые усиливали нежелательное поведение, и переносил освободившийся вес на ослабляющие примеры. Он ограничивал величину изменений и сохранял суммарный вес пакета. Итоговая точность на MMLU отличалась от обычного обучения на 0,02 процентного пункта, то есть вмешательство почти не изменило измеренную общую полезность модели.
Проверка с удалением данных и повторным обучением дала ещё один результат: высокие оценки BGU указывали на примеры, которые причинно влияли на итоговое поведение, а не просто совпадали с ним. Это отличает метод от анализа одной готовой контрольной точки.
Когда метод меняет план обучения
Работа меняет архитектуру тренировочного контура, если команда обучает или дообучает собственную модель и заранее может выразить нежелательное свойство через дифференцируемый показатель. Вместо отдельного этапа поиска плохих данных после обучения можно встроить измерение, прогноз и изменение весов между обратным проходом и шагом оптимизатора.
Для этого нужен доступ к состоянию оптимизатора, активациям и ошибкам обратного прохода. При обучении только через внешний API такой контур собрать нельзя. Понадобится также заранее определить направление желательного изменения: BGU находит отличимый вклад, но цель управления задаёт разработчик.
Границы проверки пока узкие: полный замер производительности охватывал тысячу примеров на Qwen2.5-7B-Instruct, а поведение изучали на Opinions и GSM8K Mistakes. Качество атрибуции сравнивали с EK-FAC, TRAK, TrackStar, MAGIC, LESS, LinFAC, GREATS и вариантами Shapley. Управление проверяли для одного заданного свойства за раз, а прогноз описывал ближайшее обновление модели.
Практический план поэтому выглядит не как замена подготовки датасета, а как дополнительная петля обратной связи. Сначала команда формализует измеримый признак поведения, затем проверяет точность локальных прогнозов на своих пакетах и только после этого разрешает контроллеру менять веса. Главная инженерная развилка — готова ли инфраструктура обучения выдавать нужные внутренние величины с приемлемой задержкой.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



