Журнал · Rit.work

Обнуление голов внимания может выбрать не те компоненты модели

Проверка на GPT-2 показала, что точка обнуления, выбранная метрика и контрольная группа меняют выводы о причинной роли голов внимания.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Распространённая проверка причинной роли частей языковой модели может указать не на те части. В препринте Stanford University, который не проходил рецензирование, все числа получили сами авторы: списки из пяти важнейших голов при корректном и наивном вмешательстве не совпали ни в одной позиции. Поэтому результат такого теста нельзя использовать как причинное объяснение без проверки самого вмешательства.

Голова внимания — один из параллельных блоков, которые обрабатывают связи между токенами. Чтобы оценить её роль, исследователи обнуляют её выход и смотрят, как меняется ответ модели. Но в GPT-2 выходы голов проходят через общее линейное преобразование и смешиваются: если обнулить часть результата после этого шага, тест удалит произвольную смесь сигналов, а не вклад выбранной головы. Корректный вариант вмешивается до смешивания.

Второй источник ошибки — двоичная точность, которая показывает только совпадение ответа с эталоном. На арифметической задаче GPT-2 получила 0%: дальнейшее ухудшение такая метрика уже не видит. На задаче копирования точность достигла 99,5% и могла скрывать снижение уверенности, пока модель выбирала тот же токен. Логарифм вероятности правильного продолжения сохранял чувствительность в обоих случаях.

Головы выбирали на одной половине примеров, а проверяли на другой и сравнивали со случайными наборами, включая наборы из тех же слоёв. Средний эффект выбранных голов оказался примерно в восемь раз выше среднего эффекта более строгой, послойно сопоставленной контрольной группы. Это подтверждает воспроизводимый эффект вмешательства, но не доказывает, что головы выполняют именно копирование: при повторе с большей выборкой различие между целевой и контрольной задачами ослабло.

Проверку провели на GPT-2 и DistilGPT2, двух моделях одной архитектурной семьи, с синтетическим копированием и простой арифметикой. DistilGPT2 подтвердил расхождение между двумя точками обнуления и превосходство выбранных голов над контрольными наборами, но не воспроизвёл пример с почти предельной точностью. Для аудита модели отсюда следует практический порядок: вмешиваться до смешивания выходов, измерять непрерывное изменение уверенности и проверять найденные компоненты на отложенных данных с сопоставимым контролем.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу