Журнал · Rit.work

Рекуррентность меняет доступ к рабочему пространству трансформера

Исследование Ouro и Huginn показывает: рекуррентные трансформеры сохраняют доступные для управления представления, но способ доступа зависит от архитектуры и обучения.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Wenlong Wang и Fergal Reid из Fin AI Research проверили, возникает ли в рекуррентных трансформерах функциональный аналог глобального рабочего пространства — зона представлений, содержание которой можно прочитать и причинно изменить; работа опубликована как препринт, не прошедший рецензирования. По замерам авторов, Ouro требует вмешательства во все оставшиеся циклы, тогда как у Huginn чтение и изменение состояния работают в окне примерно двух рекуррентных проходов. Результат важен разработчикам инструментов интерпретации и управления LLM с повторным использованием весов.

Что сделали

Авторы исследовали Ouro-2.6B и Huginn-0125, а стандартный Qwen3.6-27B использовали как базовый вариант без повторного применения слоёв. Рекуррентные вычисления виртуально развернули в последовательность слоёв и применили Jacobian lens: линейные преобразования, построенные по средней чувствительности последующих состояний модели к состоянию выбранного слоя. Затем проверили, можно ли читать представления, записывать в них заданные понятия и удалять их так, чтобы менялся ответ модели.

По интерпретации авторов, признаки рабочего пространства появились в обеих рекуррентных архитектурах, но внутреннее содержание поддерживается по-разному. Ouro заново формирует его в каждом цикле, поэтому однократное вмешательство частично исправляется последующими проходами. Huginn переносит содержание через все 16 рекуррентных проходов, однако линейный доступ к нему остаётся локальным. Авторы связывают способность проговаривать внедрённое извне понятие с обучением Ouro на промежуточных состояниях; управление уже существующим содержанием такой подготовки не потребовало.

Что это значит

Повторное использование весов само по себе не устраняет представления, которые можно интерпретировать и направленно менять. Но единый способ вмешательства для рекуррентных моделей не переносится автоматически: у Ouro воздействие приходится поддерживать после каждой повторной обработки, а у Huginn выбирать участок рядом с целевым состоянием. Работа при этом не делает заявлений о сознании моделей — «рабочее пространство» используется только как функциональная характеристика.

Ограничения. Авторы изучили по одному контрольному пункту каждой архитектурной семьи, поэтому влияние рекуррентности нельзя отделить от масштаба, схемы обучения и устройства границ цикла. Линзы обучались на 1000 фрагментах WikiText-103 и работают с линейным приближением и словарём однотокенных понятий; за проверенным горизонтом они могут отражать устройство измерителя, а не состояние модели. Сравнению не хватает контролируемых запусков, где меняется только рекуррентная архитектура, а также систематической проверки разных чисел проходов Huginn.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу