Журнал · Rit.work

Transformer удерживает два текста в одном проходе — пока с потерями

Смешивание представлений позволяет Transformer сохранить два текстовых потока и разделить их при генерации, но выигрыш пока остаётся экспериментальным.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Один Transformer может одновременно сохранить сигналы двух независимых текстов и продолжать оба потока через общий проход модели. На Llama-3.2-3B точность смешанной генерации достигла 43% против 54% у отдельного прохода небольшой модели; работу группа Павла Тихонова выложила как нерецензированный препринт, поэтому числа получены самими авторами. Для систем, где стоимость задаёт проход крупной модели, это открывает путь к параллельной обработке без отдельной копии вычислений для каждого текста.

Два текста смешивают до первого слоя

Авторы берут два текста одинаковой длины и для каждой позиции усредняют векторные представления их токенов. Полученную последовательность передают обычному Transformer без новых слоёв и изменений в механизме внимания.

Если модель сохраняет линейную суперпозицию, смешанный результат должен напоминать среднее двух распределений следующего токена. Иными словами, варианты продолжения каждого исходного текста остаются среди предпочтительных ответов, хотя Transformer видит только их общую последовательность векторов.

Это не означает, что модель буквально ведёт два изолированных диалога. Оба сигнала проходят через одни слои и мешают друг другу. Стандартный выбор следующего токена тоже не умеет определить, к какому потоку относится найденный вариант.

Эффект проверяли на семействах Pythia, Qwen2.5, Llama, OLMo и Gemma, используя простые рассказы TinyStories и веб-тексты FineWeb. Основные эксперименты охватывали контексты до 128 токенов, а сравнение полных распределений продолжили до 512 токенов. Работа касается преимущественно англоязычного текста и декодирующих языковых моделей, а не мультимодальных систем.

Как измеряли сохранность двух потоков

Сначала модель отдельно обрабатывала каждый текст. Исследователи брали токен, который одиночный проход поставил на первое место, а затем искали его позицию в распределении после смешивания.

Без дополнительного обучения такой токен попадал в первую десятку примерно в 30–40% случаев. В первую полусотню он входил в 50–60% случаев. Это заметно выше случайного уровня для словарей, содержащих десятки тысяч токенов, но недостаточно для прямой генерации двух надёжных ответов.

Второй тест сравнивал всё смешанное распределение со средним двух независимых распределений. Для моделей разных семейств оно оказывалось ближе к этому среднему, чем распределения двух случайно выбранных контекстов друг к другу. Значит, результат нельзя объяснить только сохранением нескольких частых слов.

Эксперименты с подменой внимания уточнили механизм. Когда веса внимания брали у другого естественного текста, предсказуемые служебные позиции часто сохранялись, но содержательные слова страдали. Случайная перестановка тех же весов разрушала результат: важна не только частотность токенов, но и обычная структура внимания с локальными связями и специализированными головами.

На контрольных точках обучения Pythia суперпозиция лучше всего работала в начале, а затем слабела. Это поддерживает гипотезу, что склонность складывать сигналы задаёт сама архитектура, тогда как обучение языку усиливает нелинейное взаимодействие между ними.

Свойство удалось частично вернуть дополнительным обучением на объёме менее 0,025% исходного набора предобучения. После него содержательные токены обоих потоков поднимались ближе к вершине распределения, хотя простое семплирование всё ещё смешивало две линии текста.

Почему одного общего прохода пока недостаточно для продукта

Главная проблема возникает при выборе следующего токена. В смешанном состоянии модель фактически учитывает предпочтения обоих потоков: токен, подходящий первому тексту, получает штраф, если он маловероятен во втором. Поэтому генерация перескакивает между продолжениями даже тогда, когда нужные варианты присутствуют среди лидеров.

Для разделения авторы добавили контрастный декодер. Небольшая вспомогательная модель отдельно оценивает каждый поток; для продолжения первого текста декодер усиливает его оценки и вычитает оценки второго, а для второго делает обратное. Крупная модель при этом выполняет один смешанный проход на шаг генерации, но вспомогательные вычисления никуда не исчезают.

Для продуктовой команды работа пока не меняет выбор основной модели или инфраструктуры. Теоретический предел схемы — два продолжения на один проход крупной основы и вдвое меньше памяти на поток для KV-кэша, где хранятся промежуточные данные внимания. Однако экспериментальный декодер уступает обычной одиночной обработке, требует дополнительной модели и проверен на коротких текстовых контекстах.

Практический вывод уже уже: при проектировании собственного сервера вывода не стоит считать один остаточный поток Transformer неделимым ресурсом. Суперпозицию можно рассматривать как направление для пакетной обработки, если команда готова обучать модель под смешанные входы и отдельно измерять качество на содержательных токенах. Заменять ею стандартное пакетирование или планировать двукратное сокращение GPU-бюджета по этой работе рано.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу