Журнал · Rit.work

Infinite-Parameter LLM переносит данные сессии в веса

Новая архитектура превращает факты и инструкции из текущей сессии в изменяемые веса, освобождая контекст и сохраняя состояние между репликами.

Rit.work
Студия разработки
17 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научили переносить факты и правила из текущего диалога в изменяемую часть весов, чтобы не перечитывать весь контекст при каждом запросе. Работа Boltzbit Limited и University of Cambridge, которая не прошла рецензирование и содержит замеры самих авторов, показала на пуле из 64 фрагментов 47,6 F1 против 27,8 у единого длинного контекста. Для продуктов с длинными сессиями это предлагает иной обмен: хранить компактное состояние вместо растущей истории.

Архитектура Infinite-Parameter LLM не хранит большой банк готовых экспертов. Компактная сеть-генератор превращает поступившие во время работы данные в низкоранговую добавку к весам общей базовой сети. Распределение вероятностей по скрытым кодам обновляется по мере диалога, поэтому выбранная конфигурация весов может сохранять факты и инструкции между репликами.

Преимущество проявилось не на любом объёме. Когда в контекст помещались восемь фрагментов, обычное чтение всего блока дало 48,8 F1, а выбор кода — 48,1. По мере роста пула результат длинного контекста ухудшался, тогда как вариант с кодами оставался почти на прежнем уровне.

На созданных для эксперимента многоходовых диалогах накопленное состояние точнее выбирало нужный код для зависимых от истории вопросов, чем поиск по каждой реплике отдельно. Повторный поиск по всей истории сначала улучшался, а затем проседал из-за разрастания запроса. У предлагаемого метода объём вычислений на реплику не зависел от её номера, хотя зависел от числа кодов в пуле.

Проверяли конкретную упрощённую реализацию: она выбирает один вариант из заранее подготовленного пула кодов, а не свободно перемещается по непрерывному пространству весов. Короткий контекст для одноразового запроса остаётся сильной альтернативой, а генерация добавок на каждом токене сама требует пропускной способности. Работа показывает выигрыш на длинных и повторно используемых данных, но не переводит его в стоимость GPU или задержку ответа.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу