Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Одинаково выглядящие внутренние репрезентации могут проверять разные гипотезы — всё зависит от того, какие преобразования координат считать несущественными. В работе Louie Hong Yao, Yuhao Li и Shengchao Liu линейный классификатор и направляющий вектор сравниваются как разные объекты, хотя в коде оба записаны массивами одной размерности; работа не прошла рецензирование, а числа в ней получили сами авторы. Поэтому результаты анализа нельзя переносить между методами только на основании совпавшей формы данных.
Авторы предлагают описывать каждое утверждение четырьмя частями: допустимыми преобразованиями репрезентации, типом извлекаемого объекта, процедурой его получения и проверяемым свойством. Преобразования задают эквивалентность: например, можно разрешить любой обратимый сдвиг координат либо только повороты и равномерное изменение масштаба. Чем шире этот набор, тем меньше геометрических свойств можно приписать самой модели.
Показательный случай — один вектор, вычисленный как разность средних активаций. При добавлении к активациям важны его направление и длина. При удалении соответствующей компоненты после нормализации важным остаётся только направление. Обе операции корректны, но первая рассматривает вектор как смещение, а вторая — как линию без фиксированного масштаба; вместе они не доказывают существование одной универсальной «оси отказа».
Архитектура дополнительно ограничивает допустимые выводы. В механизме внимания координаты запросов и ключей можно изменить обратимым преобразованием и компенсировать его в параметрах, не меняя функцию модели. Поэтому углы и косинусное сходство в этих точках могут характеризовать конкретную параметризацию, а не поведение модели. Для остаточного потока то же преобразование действует иначе, поэтому в отчёте нужно указывать, где именно сняты активации.
Работа теоретическая: она разбирает линейное декодирование, векторы вмешательства, разреженные словари, сравнение репрезентаций и многоэтапные схемы анализа. Практический вывод для команд, которые строят инструменты интерпретируемости, — проверять всю цепочку целиком: способ оценки направления, метрику сравнения, нормализацию и вмешательство. Если этапы сохраняют разные свойства, итог относится не к абстрактной репрезентации, а к выбранным координатам и геометрии.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



