Журнал · Rit.work

CRU гасит выбранное знание в LLM без правки базовых весов

CRU локализует связанные с удаляемым знанием нейроны и подключает к ним маршрутизаторы, сокращая расход памяти без переобучения базовой LLM.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Заданное знание из LLM удалось убрать, не меняя базовые веса модели. В работе Sapienza University of Rome и Aarhus University метод CRU снизил полноту извлечения — долю найденных ответов — при атакующих проверках до 0,052 против 0,250 у лучшего метода сравнения, хотя препринт не рецензирован и все числа получили сами авторы. Для продукта это открывает путь к отдельным, отключаемым слоям забывания вместо выпуска новой версии всей модели.

Как CRU находит и гасит нужные нейроны

CRU разделяет задачу на локализацию знания и управление его выражением. Сначала модель один раз прогоняет набор примеров, которые нужно забыть, через последние четыре блока декодера. Для каждого примера метод усредняет активации по токенам и ранжирует нейроны по тому, насколько сильно их значения меняются между примерами.

Высокая изменчивость служит дешёвым признаком связи с целевым понятием. Такой отбор не требует обратного распространения ошибки или обучения базовой модели. Он ищет не место, где факт хранится в буквальном смысле, а нейроны, через которые знание выражается перед формированием ответа.

К выбранным нейронам подключают небольшие маршрутизаторы. Каждый маршрутизатор читает состояние текущего токена и решает, пропустить активацию или приглушить её. Поэтому один и тот же нейрон может работать в обычном запросе и отключаться, когда запрос ведёт к удаляемому знанию.

Маршрутизаторы обучают напрямую: на удаляемых примерах затворы должны закрываться, на сохраняемых — оставаться открытыми. Градиенты не проходят через базовую LLM, а обучаемые модули содержат около 0,01% от числа её параметров. Если поведение меняется, причиной остаются затворы, поскольку исходные веса заморожены.

Проверка со случайным выбором нейронов дала результат, близкий к исходной модели: одного приглушения недостаточно, важна локализация. При этом меньшее число выбранных нейронов не обязательно бережнее сохраняет остальные способности. Когда доступных путей мало, маршрутизатор сильнее подавляет оставшиеся и может одновременно ухудшить забывание и полезность.

Память сократилась, а модель сохранила полезность

На TOFU CRU по качеству забывания статистически не отличался от эталона, переобученного без удаляемых примеров. Методы, которые меняют веса всей модели, на крупных наборах достигали сопоставимого забывания лишь ценой резкого падения качества на сохраняемых данных. CRU не оказался хуже альтернатив одновременно по обеим сторонам этого компромисса.

RWKU проверяет, можно ли восстановить знание более настойчивыми и косвенными запросами. По мере усложнения таких запросов методы сравнения чаще выдавали целевые сведения, тогда как CRU удерживал результат, вынесенный в лид. Это отличает подавление самого пути к знанию от обучения модели стандартному отказу на знакомую формулировку.

На TOFU пиковый расход памяти при работе с Phi снизился с 71 GiB до 14 GiB, поскольку CRU не хранит градиенты и состояние оптимизатора для базовой модели. На RWKU обработка одной цели заняла 24 минуты против 52 минут у NPO. Выигрыш по времени зависит от метода сравнения: на TOFU некоторые подходы работали быстрее CRU.

Границы проверки заданы моделями семейств DeepSeek, Qwen, Llama и Phi, наборами TOFU и RWKU и набором градиентных, предпочтительных и контекстных методов сравнения. Замеры памяти провели на Phi в полной точности, а выбор последних блоков опирается на предыдущие работы о том, где трансформер выражает семантические признаки.

Когда CRU меняет архитектурный план

Подход подходит командам, которые управляют весами модели и графом её выполнения. Маршрутизатор нужно встроить между блоками трансформера, поэтому подключить CRU поверх обычного текстового API без доступа к внутренним активациям не получится.

Для собственной LLM метод предлагает не создавать отдельный изменённый набор весов под каждый запрос на удаление. Можно держать базовую модель неизменной, обучать отдельный комплект маршрутизаторов для конкретного понятия и отключать его при откате. Такое устройство упрощает атрибуцию изменений: если после удаления просело качество, область вмешательства известна.

Маршрутизация во время запроса также меняет компромисс между забыванием и полезностью. Постоянная маска подавляет выбранные нейроны для любого текста, а CRU решает это для каждого токена. Близкие по теме, но не обращающиеся к удаляемому знанию запросы получают больше шансов пройти без вмешательства.

Работа пока не закрывает сценарий, где нужно последовательно или одновременно забывать много понятий: каждый запрос обучает собственные маршрутизаторы, а их совместное поведение не проверяли. Кроме того, результаты показывают приближение к модели, переобученной без целевых данных, но не дают формального сертификата точного удаления. Для продукта CRU стоит рассматривать как архитектуру управляемого подавления, которую всё равно нужно проверять и на извлечение удалённого знания, и на сохранение рабочих возможностей модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу