Журнал · Rit.work

Линейная репрезентация зависит от того, какие преобразования считать допустимыми

Одинаковые массивы чисел могут обозначать разные внутренние объекты модели, поэтому линейные классификаторы и вмешательства не всегда проверяют одну гипотезу.

Rit.work
Студия разработки
24 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Одинаково выглядящие внутренние репрезентации могут проверять разные гипотезы — всё зависит от того, какие преобразования координат считать несущественными. В работе Louie Hong Yao, Yuhao Li и Shengchao Liu линейный классификатор и направляющий вектор сравниваются как разные объекты, хотя в коде оба записаны массивами одной размерности; работа не прошла рецензирование, а числа в ней получили сами авторы. Поэтому результаты анализа нельзя переносить между методами только на основании совпавшей формы данных.

Авторы предлагают описывать каждое утверждение четырьмя частями: допустимыми преобразованиями репрезентации, типом извлекаемого объекта, процедурой его получения и проверяемым свойством. Преобразования задают эквивалентность: например, можно разрешить любой обратимый сдвиг координат либо только повороты и равномерное изменение масштаба. Чем шире этот набор, тем меньше геометрических свойств можно приписать самой модели.

Показательный случай — один вектор, вычисленный как разность средних активаций. При добавлении к активациям важны его направление и длина. При удалении соответствующей компоненты после нормализации важным остаётся только направление. Обе операции корректны, но первая рассматривает вектор как смещение, а вторая — как линию без фиксированного масштаба; вместе они не доказывают существование одной универсальной «оси отказа».

Архитектура дополнительно ограничивает допустимые выводы. В механизме внимания координаты запросов и ключей можно изменить обратимым преобразованием и компенсировать его в параметрах, не меняя функцию модели. Поэтому углы и косинусное сходство в этих точках могут характеризовать конкретную параметризацию, а не поведение модели. Для остаточного потока то же преобразование действует иначе, поэтому в отчёте нужно указывать, где именно сняты активации.

Работа теоретическая: она разбирает линейное декодирование, векторы вмешательства, разреженные словари, сравнение репрезентаций и многоэтапные схемы анализа. Практический вывод для команд, которые строят инструменты интерпретируемости, — проверять всю цепочку целиком: способ оценки направления, метрику сравнения, нормализацию и вмешательство. Если этапы сохраняют разные свойства, итог относится не к абстрактной репрезентации, а к выбранным координатам и геометрии.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу