Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Предобученную LLM научились сворачивать длинный текст в фиксированное непрерывное представление и почти без потерь разворачивать его обратно. В нерецензированном препринте University of California, Irvine все числа получили сами авторы: LLMAE восстановил новостные тексты с результатом 0,999 по BLEU-4. Это позволяет обучать отдельные генеративные модели поверх текста, не меняя саму LLM под каждую задачу.
Как текст проходит через внутренний слой LLM
Автоэнкодер сначала превращает исходный объект в компактное внутреннее представление, а затем восстанавливает объект из него. Для изображений такие представления давно используют как рабочее пространство генеративных моделей. С текстом сложнее: порядок слов важен, а небольшая ошибка при восстановлении быстро меняет смысл.
LLMAE строится на Gemma 3 с 270 млн параметров. Модель получает исходный текст и специальные обучаемые токены, которые собирают информацию о нём на промежуточном слое. После этого маска внимания закрывает декодеру доступ к исходным токенам: восстановить текст он может только по сохранённому представлению и уже сгенерированной части ответа.
Так одна LLM выполняет обе роли. Ранние слои кодируют текст, а поздние используют результат как контекст для обычной последовательной генерации. Авторы выбрали глубокий промежуточный слой, где внутренние признаки модели уже отражают структуру текста, но ещё не превратились в распределение следующего токена.
Текст длиной до 1024 токенов сворачивается в последовательность из 256 скрытых токенов. Небольшой трансформерный кодек дополнительно выравнивает это пространство, а регуляризация приближает распределение скрытых признаков к нормальному и удерживает ответы рядом с исходным поведением Gemma 3. Благодаря LoRA обучать приходится 10,7 млн параметров, а не всю модель.
Главное отличие от компрессоров контекста — назначение результата. LLMAE не просто сокращает запрос для последующей передачи в LLM. Он создаёт фиксированное непрерывное пространство, в котором другая модель может учиться преобразовывать текст целиком: добавлять шум, убирать его или связывать текстовые признаки с изображением.
Почти точное восстановление оказалось полезно для генерации
Качество восстановления проверяли на C4-RealNewsLike, OpenWebText и CreationMMBench. BLEU-4 измеряет совпадение коротких последовательностей слов между исходным и восстановленным текстом. На новостной выборке LLMAE получил 0,999 против 0,831 у ICAE и 0,783 у COSMOS; семантическая метрика BERTScore и перплексия также показали близкое к исходнику восстановление.
Одной реконструкции недостаточно: скрытое пространство может запоминать текст, но оставаться неудобным для генерации. Поэтому поверх замороженного LLMAE обучили диффузионную модель для подробного описания изображений. Она получает признаки изображения от замороженного SigLIP, предсказывает текстовое представление, а декодер LLMAE превращает его в подпись.
Модель-оценщик GPT-4o поставила такой системе 3,44 балла. При замене LLMAE на COSMOS с той же архитектурой диффузионной модели результат снизился до 2,24. Это более содержательное сравнение, чем сопоставление с произвольной крупной моделью: менялся именно текстовый автоэнкодер.
Проверка охватывает Gemma 3, тексты нескольких стилей и подробное описание изображений. Декодер при этом остаётся авторегрессионным: он по-прежнему выпускает токены последовательно, поэтому LLMAE не сокращает задержку при генерации длинного ответа. Плотное скрытое пространство также требует достаточно сильного сигнала от изображения или другого условия.
Когда LLMAE меняет архитектурный план
Для обычного чат-бота или генератора текста работа не даёт прямой причины заменять существующую LLM. Финальный ответ создаётся тем же последовательным способом, а перед ним появляется дополнительный этап кодирования. Если задача сводится к продолжению запроса, привычный авторегрессионный стек остаётся проще.
Планы меняются там, где текст должен стать промежуточным типом данных. Вместо дообучения всей LLM под изображение, звук или другой источник можно заморозить автоэнкодер и учить отдельную модель отображать входные признаки в его скрытое пространство. Исходная LLM сохраняет языковые навыки, а прикладной слой отвечает за новую модальность.
Такой подход также разделяет дорогие этапы. Тексты можно заранее закодировать и сохранить их представления, чтобы не прогонять один и тот же корпус через LLM на каждой эпохе. Эксперименты становятся ближе к работе с латентными представлениями изображений: команда меняет генеративную модель или условный сигнал, не перестраивая текстовый декодер.
Закладывать LLMAE как готовый универсальный компонент пока рано: результаты получены на конкретной компактной Gemma 3 и в одной downstream-задаче. Но работа показывает проверяемый архитектурный путь — использовать внутренний слой предобученной LLM как границу между языком и прикладной моделью, а не дообучать весь языковой стек для каждой интеграции.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



