Журнал · Rit.work

ReFlux возвращает трансформеру только новые вычисления

ReFlux передаёт ранним слоям не полное состояние модели, а накопленную между слоями разницу и повышает точность рассуждений при замороженной основной сети.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Замороженная языковая модель смогла повторно использовать выполненные вычисления и точнее отвечать без переобучения основной сети. В работе Tongji University, Shanghai Jiao Tong University и Shanghai Innovation Institute, которая не рецензирована, все числа получили сами авторы: ReFlux повысил среднюю точность на задачах рассуждения на 2,1–2,3 процентного пункта. Потоковый режим сохранил большую часть прироста, почти не увеличив время генерации.

Обычный трансформер последовательно дополняет внутреннее представление токена на каждом слое. Прежние способы обратной связи возвращали раннему слою полное состояние позднего, хотя оно содержит и унаследованную информацию, и новый результат вычислений. ReFlux вычитает раннее состояние из позднего и передаёт назад только разницу — то, что модель добавила между двумя слоями.

Обучаемый маршрутизатор выбирает для каждого входа, между какими слоями передавать эту разницу и с какой силой. Основная модель остаётся замороженной. В синхронном режиме ReFlux повторно обрабатывает тот же токен, а в потоковом переносит результат к следующему токену и поэтому не запускает основную сеть второй раз.

Синхронный режим снизил перплексию — меру неопределённости следующего токена — на всех десяти корпусах. На многошаговых вопросах прирост точности достиг 4,7 пункта. Потоковый режим сохранил исходное число вычислительных операций основной сети, а фактическое время декодирования выросло на 2–8%; синхронный вариант работал примерно в 1,9 раза дольше.

Метод проверяли на Gemma3 и Qwen3 разных размеров, на языковом моделировании и восьми наборах задач рассуждения; сравнивали с возвратом полного состояния и повторным прогоном слоёв. Для продуктовой команды это не замена модели через внешний API: ReFlux требует доступа к внутренним состояниям и отдельной настройки маршрутизатора. Но при собственном развёртывании он показывает способ получить дополнительное качество без обучения всей LLM и почти без удорожания потоковой генерации.

Источники

Иллюстрация: рисунок из статьи «Write Back the $\Delta$: Revisiting the Same Tokens with Fresh Representations», Wencheng Ye, Anning Hu, Xiangdong Zhang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу