Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Замороженную языковую модель научили лучше решать математические задачи, меняя связи между уже выполненными вычислениями, а не её основные веса. Liuxian Ma и коллеги показали T-Router: в их опыте он обошёл полное обновление весов через GRPO на 9,85 процентного пункта, хотя препринт не рецензирован и все числа получили сами авторы. Метод добавляет ещё один вариант между LoRA и дорогим обучением всей модели, но требует вмешательства во внутреннее устройство LLM.
Как модель возвращает результаты прежних блоков
Обычная параметроэффективная настройка вроде LoRA обучает небольшие низкоранговые добавки к весам. T-Router оставляет преобразования внутри модели неизменными и учится управлять тем, как слои используют результаты предыдущих вычислений.
После завершения очередной группы слоёв модуль вычисляет разницу между входом и выходом блока. Он сжимает эту разницу и кладёт её в адресуемый банк вместе с указанием источника. В основной конфигурации новый источник появляется после каждых четырёх слоёв.
Перед следующим слоем маршрутизатор получает текущее скрытое состояние и контекст от рекуррентного контроллера. Контроллер накапливает историю прохождения по глубине модели в отдельных ячейках. По запросу текущего слоя он выбирает смесь сохранённых изменений и определяет, насколько сильно вернуть её в основной поток вычислений.
Возврат проходит через знаковый затвор: добавка может как усилить выбранное направление, так и ослабить его. Перед этим модуль выравнивает масштаб добавки относительно текущего состояния, поэтому одно и то же значение затвора означает сопоставимое вмешательство на разных слоях.
Банк хранит изменения для той же позиции токена и не создаёт отдельного поиска по истории текста. Он существует только во время текущего прохода модели и затем сбрасывается. Все исходные слои выполняются в прежнем порядке, а награда за правильный ответ обучает только дополнительный путь выбора и возврата данных.
Переиспользование вычислений обошло LoRA при близком бюджете
Основной эксперимент провели на Qwen3.5-9B-Base. Модель обучали с наградой за правильность на полном наборе GSM8K, а затем проверяли на GSM8K, MATH-500 и задачах AIME двух выпусков. Итоговую метрику MathAvg считали как среднюю точность по этим трём семействам и усредняли по трём раундам оценки.
T-Router выделял 41,73 млн параметров и получил 83,64 балла MathAvg. LoRA с тем же правилом повторных попыток использовала 43,28 млн параметров и набрала 77,28. Сопоставимые бюджеты и одинаковое формирование обучающих групп делают это сравнение полезнее, чем простое сопоставление с полной настройкой модели.
Разрыв возник не только на GSM8K, откуда взяли обучающие примеры. T-Router оказался впереди и на MATH-500, и на AIME. Это поддерживает основную гипотезу работы: награда может обучать не новые преобразования, а порядок повторного использования уже доступных промежуточных результатов.
Когда T-Router меняет план разработки
Работа не даёт оснований автоматически заменять LoRA во всех проектах. Она добавляет в список прототипов другой класс адаптации: вместо обновления весов команда может обучать дополнительную связь между слоями замороженной модели. Такой подход особенно уместен, если важно сохранить исходный каркас и при этом доступно обучение с проверяемой наградой, например за правильный ответ задачи.
Цена этой схемы — более сложное исполнение. T-Router должен получать скрытые состояния внутри декодера, записывать изменения блоков и добавлять выбранную смесь перед следующими слоями. Его нельзя реализовать поверх API, которое возвращает только готовый текст: нужен контроль над прямым проходом модели и поддержка дополнительного модуля при обучении и выводе.
Основная проверка охватывает один базовый каркас и математические задачи. Авторы также отдельно обучили модуль для поиска с инструментами и проверили его на BrowseComp Plus и ASearch Test, однако это другой цикл обучения, а не перенос математического маршрутизатора без настройки. Для продуктового решения остаётся проверить метод на своей модели, длинах контекста и требованиях к задержке.
Практический вывод пока узкий: если команда уже планирует параметроэффективное обучение рассуждению, T-Router стоит сравнить с LoRA на одном бюджете генераций и одинаковом правиле повторных попыток. Если продукт работает через закрытый API или не допускает изменения прохода по слоям, работа планов не меняет.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



