Журнал · Rit.work

T-Router учит замороженную LLM связывать прежние вычисления по-новому

T-Router хранит изменения между блоками замороженной модели и учится выбирать, какие из них вернуть в вычисление на следующих слоях.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Замороженную языковую модель научили лучше решать математические задачи, меняя связи между уже выполненными вычислениями, а не её основные веса. Liuxian Ma и коллеги показали T-Router: в их опыте он обошёл полное обновление весов через GRPO на 9,85 процентного пункта, хотя препринт не рецензирован и все числа получили сами авторы. Метод добавляет ещё один вариант между LoRA и дорогим обучением всей модели, но требует вмешательства во внутреннее устройство LLM.

Как модель возвращает результаты прежних блоков

Обычная параметроэффективная настройка вроде LoRA обучает небольшие низкоранговые добавки к весам. T-Router оставляет преобразования внутри модели неизменными и учится управлять тем, как слои используют результаты предыдущих вычислений.

После завершения очередной группы слоёв модуль вычисляет разницу между входом и выходом блока. Он сжимает эту разницу и кладёт её в адресуемый банк вместе с указанием источника. В основной конфигурации новый источник появляется после каждых четырёх слоёв.

Перед следующим слоем маршрутизатор получает текущее скрытое состояние и контекст от рекуррентного контроллера. Контроллер накапливает историю прохождения по глубине модели в отдельных ячейках. По запросу текущего слоя он выбирает смесь сохранённых изменений и определяет, насколько сильно вернуть её в основной поток вычислений.

Возврат проходит через знаковый затвор: добавка может как усилить выбранное направление, так и ослабить его. Перед этим модуль выравнивает масштаб добавки относительно текущего состояния, поэтому одно и то же значение затвора означает сопоставимое вмешательство на разных слоях.

Банк хранит изменения для той же позиции токена и не создаёт отдельного поиска по истории текста. Он существует только во время текущего прохода модели и затем сбрасывается. Все исходные слои выполняются в прежнем порядке, а награда за правильный ответ обучает только дополнительный путь выбора и возврата данных.

Переиспользование вычислений обошло LoRA при близком бюджете

Основной эксперимент провели на Qwen3.5-9B-Base. Модель обучали с наградой за правильность на полном наборе GSM8K, а затем проверяли на GSM8K, MATH-500 и задачах AIME двух выпусков. Итоговую метрику MathAvg считали как среднюю точность по этим трём семействам и усредняли по трём раундам оценки.

T-Router выделял 41,73 млн параметров и получил 83,64 балла MathAvg. LoRA с тем же правилом повторных попыток использовала 43,28 млн параметров и набрала 77,28. Сопоставимые бюджеты и одинаковое формирование обучающих групп делают это сравнение полезнее, чем простое сопоставление с полной настройкой модели.

Разрыв возник не только на GSM8K, откуда взяли обучающие примеры. T-Router оказался впереди и на MATH-500, и на AIME. Это поддерживает основную гипотезу работы: награда может обучать не новые преобразования, а порядок повторного использования уже доступных промежуточных результатов.

Когда T-Router меняет план разработки

Работа не даёт оснований автоматически заменять LoRA во всех проектах. Она добавляет в список прототипов другой класс адаптации: вместо обновления весов команда может обучать дополнительную связь между слоями замороженной модели. Такой подход особенно уместен, если важно сохранить исходный каркас и при этом доступно обучение с проверяемой наградой, например за правильный ответ задачи.

Цена этой схемы — более сложное исполнение. T-Router должен получать скрытые состояния внутри декодера, записывать изменения блоков и добавлять выбранную смесь перед следующими слоями. Его нельзя реализовать поверх API, которое возвращает только готовый текст: нужен контроль над прямым проходом модели и поддержка дополнительного модуля при обучении и выводе.

Основная проверка охватывает один базовый каркас и математические задачи. Авторы также отдельно обучили модуль для поиска с инструментами и проверили его на BrowseComp Plus и ASearch Test, однако это другой цикл обучения, а не перенос математического маршрутизатора без настройки. Для продуктового решения остаётся проверить метод на своей модели, длинах контекста и требованиях к задержке.

Практический вывод пока узкий: если команда уже планирует параметроэффективное обучение рассуждению, T-Router стоит сравнить с LoRA на одном бюджете генераций и одинаковом правиле повторных попыток. Если продукт работает через закрытый API или не допускает изменения прохода по слоям, работа планов не меняет.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу