Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
В языковых моделях научились находить внутренние компоненты, которые действительно влияют на выбранное поведение, и ранжировать их одним обучением. На Mechanistic Interpretability Benchmark метод MAttr получил 5,6 балла против 1,95 у ближайшего участника, хотя работа пока не рецензирована, а числа получили сами авторы. Для команд это сокращает перебор при аудите модели и даёт способ точечно исследовать последствия дообучения.
Как одна маска превращается в порядок важности
Обычная атрибуция отвечает на вопрос: какие головы внимания, нейроны, связи или веса сильнее всего повлияли на результат модели. Причинная проверка требует по очереди вмешиваться в каждый компонент и заново запускать модель. Градиентные методы обрабатывают компоненты параллельно, но их оценки не всегда совпадают с реальным эффектом вмешательства.
MAttr совмещает обучение маски с причинной проверкой. Для каждого примера берут основной и контрфактический входы. Затем активации части компонентов на основном запуске заменяют активациями из контрфактического запуска и проверяют, сохранила ли модель исходный ответ.
Каждый компонент получает обучаемую оценку. На очередном шаге алгоритм случайно выбирает бюджет k и строит мягкую маску, сумма значений которой равна этому бюджету. Компоненты с высокой оценкой сохраняют свои активации, остальные постепенно заменяются контрфактическими.
Маску обучают так, чтобы при ограниченном бюджете модель как можно лучше сохраняла исходное поведение. Поскольку бюджет меняется на каждом шаге, алгоритм одновременно учится работать при разных уровнях разреженности. Получается вложенный порядок: при увеличении бюджета новый набор включает компоненты из предыдущего, как части матрёшки.
Такой подход не требует отдельного штрафа за число выбранных компонентов и не обучает новую маску для каждого бюджета. Результат следует читать как ранжирование, а не как готовое смысловое объяснение нейрона. Верхняя часть списка показывает, какие компоненты нужно сохранить, чтобы быстрее всего вернуть исходное поведение при причинном вмешательстве.
Где MAttr оказался точнее прежних методов
На официальной таблице MIB метод занял первое место. Основная метрика CPR сводит в одно значение кривую, которая показывает, как быстро выбранные компоненты восстанавливают поведение модели при росте бюджета. MAttr статистически значимо обошёл все проверенные альтернативы и на уровне узлов, и на уровне связей.
Отдельное преимущество проявилось рядом с другими методами обучения масок. Чтобы проверить несколько уровней разреженности, базовым подходам приходилось обучать несколько вариантов; такой перебор стоил примерно в 50 раз больше одного запуска MAttr. Градиентные методы остаются проще, но хуже находили компоненты с подтверждаемым причинным эффектом.
Проверка охватывала gpt2-small, Qwen2.5-0.5B, gemma-2-2b и Llama-3.1-8B. В MIB использовали поиск косвенного дополнения, арифметику, вопросы с вариантами ответа и задачи ARC. В расширенной версии авторы также ранжировали отдельные нейроны MLP, головы внимания и признаки разреженных автоэнкодеров; эти дополнительные опыты проводили на Llama.
Ранжирование частично переносилось между родственными задачами. Это позволяет искать не только цепочку для одного набора примеров, но и общие компоненты близких навыков. При этом метод учит одну скалярную оценку на всём датасете: он не выдаёт отдельную карту причин для каждого запроса или контрольной точки модели.
Когда работа меняет планы команды
MAttr полезен там, где команда уже собиралась проводить причинный аудит модели: искать цепочки вычислений, сравнивать навыки или разбирать последствия дообучения. Вместо полного перебора компонентов или серии масок можно обучить единый порядок важности, а затем проверить его жёсткими вмешательствами при нужном бюджете.
Авторы показали и более прикладной сценарий — атрибуцию изменений весов после дообучения. MAttr обучали с подкреплением по оценкам автоматического классификатора отказов. Возврат 1% весов Llama-3.1-8B-Instruct к состоянию базовой модели убрал отказы, сохранив остальные проверенные возможности; методы сравнения могли менять весь набор параметров.
Этот опыт показывает, что поведение после дообучения иногда связано с компактной частью разницы между весами. MAttr помогает найти такую часть и проверить её причинно, а не просто выбрать параметры с большим градиентом или большим абсолютным изменением.
Для плана разработки это не новый способ обучать основную модель и не самостоятельный механизм безопасности. Это инструмент диагностики после обучения. Перед использованием результатов для правки продукта придётся повторить проверку на собственной модели, целевом поведении и контрольных задачах: эксперимент с весами в работе разбирает отказы, а не произвольные продуктовые сценарии.
Источники
Иллюстрация: рисунок из статьи «Matryoshka attribution: Learning to attribute language model outputs to representations and weights», Aryaman Arora, Kirill Acharya, Nathan Hu и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



