Журнал · Rit.work

Лишний вход скрывает автомат внутри Householder linear RNN

Удаление прямого добавления входа помогло Householder linear RNN точно отслеживать состояние на длинных последовательностях, но результат применим к узкому классу задач.

Rit.work
Студия разработки
17 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Линейная RNN может выучить точный конечный автомат, но скрыть его за ошибками на длинных последовательностях из-за лишнего входного пути. В препринте Gunner Levi Howe, который не прошёл рецензирование и где числа получил сам автор, модель без этого пути сохраняла точность на длине 512 после обучения на длине 32. Для разработчиков точных трекеров состояния это даёт простой тест уже обученной модели, но не готовый рецепт для языковых моделей.

Прямое добавление входа конкурирует с переходами состояния

В работе проверяли однослойную линейную RNN с переходами Householder. На каждом шаге произведение отражений преобразует скрытое состояние, а отдельный путь напрямую добавляет к нему вектор входа: b_t = W_b e_t.

Без прямого добавления вход всё ещё управляет моделью: он выбирает ортогональный переход состояния. Такая схема буквально повторяет конечный автомат — каждый символ запускает преобразование, которое переводит систему из одного состояния в другое.

Эксперимент сравнивал одну архитектуру при одинаковой ширине, данных и бюджете обучения. Менялся только член b_t. Скрытое состояние имело размерность 112; проверка охватывала пять задач — parity, mod-3, S4, A5 и S5 — и по пять запусков для основной конфигурации.

Задачи требовали после каждого символа указывать текущее положение выбранного элемента. Поэтому модель должна была не распознать всю последовательность целиком, а точно обновлять состояние на каждом шаге.

Ширину перехода задавало число отражений Householder на символ. Минимальная достаточная ширина зависела от того, как формат задачи заставлял представить перестановки. Это объясняет, почему прежние эксперименты с S4 и A5 могли работать при меньшей ширине: классификация элемента группы и пошаговое отслеживание позиции допускают разные внутренние представления.

Точный автомат оставался внутри обученной модели

С прямым добавлением входа модель без ошибок проходила знакомую длину, но затем теряла состояние. На S5 медианная точность в конце длинной последовательности падала до 0,20. После удаления этого пути та же архитектура при минимально достаточной ширине достигала 1,00.

Причину проверили не только обучением с нуля. Модель инициализировали точным решением при нулевом W_b, после чего Adam начинал увеличивать вклад прямого входа и уводил результат от точного автомата. Контрольная версия без этого пути сохраняла решение.

Ортогональные переходы сохраняют норму скрытого состояния, а прямое добавление может её увеличивать. Предложенное в работе объяснение состоит в том, что функция потерь поощряет более крупные значения на выходе, поэтому оптимизатор использует доступный канал роста. На обучающей длине накопленный сдвиг не мешает, но за её пределами ошибка продолжает расти.

Особенно показателен тест после обучения. У всех 49 запусков, которые освоили знакомую длину, отключение W_b не испортило результат внутри обучающего диапазона. При минимальной ширине тот же приём восстановил перенос на длинные последовательности в 18 из 20 запусков. Значит, прямой путь не выполнял основную работу: переходы уже содержали автомат, а добавленный вектор маскировал его.

Эффект оказался не универсальным. При избыточной ширине переходы могли приспособиться к прямому пути, поэтому его отключение помогало нестабильно. Задача mod-3 также не закреплялась в точном решении даже без добавления: модель постепенно уходила в ошибочный поворот состояния.

Планы стоит менять только для точных трекеров состояния

Если продукт использует Householder linear RNN для пошагового исполнения правил, разбора протокола или другого конечного процесса, прямой вход стоит включить в архитектурное сравнение. Полезный диагностический прогон — оценить обученную модель с W_b := 0. Он покажет, скрывается ли под накопленной ошибкой рабочий автомат.

Удалять путь заранее тоже имеет смысл проверять как базовую конфигурацию, когда вход нужен только для выбора перехода. Работа показывает, что в таком режиме дополнительная выразительность не помогает и может направить оптимизацию к решению, которое работает лишь на знакомой длине.

При выборе ширины нельзя переносить число отражений из другого бенчмарка только по названию группы. Формат ответа определяет доступное представление состояния, а оно — минимальное число преобразований на шаг. Классификация всей группы и отслеживание отдельной позиции проверяют разные архитектурные возможности.

Для языковой модели вывод гораздо уже. Там прямой вход переносит содержание токена, а не только выбирает переход, поэтому его удаление может лишить модель необходимой информации. Эксперимент охватывает одну архитектурную семью, один оптимизатор, пошаговое линейное чтение состояния и задачи со словарём из двух генераторов. Он обосновывает диагностическую абляцию, но не общий отказ от аддитивных входов в RNN.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу