Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Несколько ответов одной диффузионной языковой модели удалось сделать менее повторяющимися и за счёт этого улучшить итог голосования без обучения и дополнительных проходов модели. Хотя препринт Michael Helcig и Martin Jaggi из ETH Zürich и EPFL не рецензирован и все числа получили сами авторы, на GSM8K доля верных итогов выросла с 70,17% до 80,38%. Для команд, которые уже генерируют несколько вариантов ответа, это повод изменить декодер, а не переобучать модель.
Как траектории отталкиваются внутри одного шага
Диффузионная языковая модель начинает с последовательности масок и постепенно заполняет позиции. На каждом шаге она оценивает все незаполненные места параллельно, а затем фиксирует самые уверенные токены. Это отличает её от авторегрессионной модели, которая добавляет токены слева направо.
Self-Repulsion запускает для одного запроса десять траекторий в общем пакете. В основной конфигурации каждая проходит 128 шагов. Один проход модели сразу выдаёт оценки токенов для всего пакета, после чего траектории фиксируют свои варианты по очереди.
Поздняя траектория видит, какие токены ранние уже поставили в ту же позицию. Декодер уменьшает логит такого токена — числовую оценку до превращения её в вероятность — пропорционально числу совпавших соседей. Чем чаще токен уже встречается в этой позиции, тем труднее следующей траектории выбрать его снова.
Последовательный порядок принципиален. Если все траектории читают состояние пакета только в начале шага, при нулевой температуре они получают одинаковые оценки и остаются копиями друг друга. В каскаде каждое новое решение меняет условия для следующего, поэтому варианты расходятся даже без случайного выбора.
Штраф действует только на ранней части декодирования. Расписание заполнения, правило выбора уверенных позиций и финальное голосование остаются прежними. Метод не требует обратного прохода, дополнительного вызова модели или отдельного обучения: он читает уже сохранённые токены пакета и корректирует текущие оценки.
Для позиции, где все траектории одновременно видят одинаковые оценки, каскад точно решает задачу обмена качества на число повторов: сильный токен может получить несколько голосов, но каждое следующее совпадение обходится дороже. Это локальная гарантия, а не описание всего ответа: такие совместные фиксации охватывали 4,9% позиций.
Голосование выигрывает от охвата, а не от шума
Финальный ответ выбирают простым большинством среди полученных вариантов. Self-Repulsion также превзошёл 77,05%, которые дала обычная самосогласованность — независимая генерация нескольких рассуждений с последующим голосованием.
При температуре 0,6 и одинаковом бюджете вычислений преимущество зависело от режима декодирования. В режиме с блоками прирост составил 2,06 процентного пункта, а при заполнении всего полотна диффузией — 14,50 пункта. Большой разрыв появился там, где исходный декодер чаще повторял одинаковые ответы.
Основной эффект дал охват: вероятность того, что среди вариантов вообще есть правильный ответ. Само голосование не стало заметно лучше выбирать правильный вариант из уже сформированного набора. Это важная граница метода: разнообразие расширяет выбор, но не заменяет проверку ответа.
Метод проверяли на LLaDA-8B-Instruct в задачах GSM8K, MATH и TruthfulQA, а отдельный опыт на LLaDA-1.5 повторил направление эффекта для GSM8K. Сравнения идут с реализациями базовых методов из той же работы и при согласованном числе вычислений модели. Поэтому результаты описывают семейство LLaDA и эти режимы декодирования, а не диффузионные модели вообще.
Когда менять декодер, а когда не менять планы
Работа меняет планы команд, которые уже используют маскированную диффузионную модель, держат несколько траекторий в одном пакете и выбирают ответ голосованием. В такой системе Self-Repulsion можно проверить как локальную замену стратегии декодирования: нужны счётчик токенов по позициям, поправка к логитам и последовательная фиксация траекторий внутри шага.
Переобучать модель или собирать разметку для отдельного оценщика не требуется. Однако метод не делает ансамбль бесплатным: все траектории по-прежнему нужно вычислять. Он лишь не добавляет новых проходов относительно обычной генерации того же числа вариантов.
Для авторегрессионной модели перенос не выглядит равноценным. Она не может отложить спорную позицию и затем исправить соседние токены, потому что генерирует их в фиксированном порядке. Метод также не помогает продукту, который возвращает единственный ответ и не держит параллельный пакет, а через закрытый API его нельзя реализовать без доступа к логитам и циклу декодирования.
Практическая проверка должна сравнивать стратегии при одинаковом общем бюджете вычислений, а не только при одинаковом числе ответов. Стоит отдельно измерить охват правильных ответов и точность финального голосования: первое показывает, нашла ли система решение, второе — смогла ли его выбрать. Работа сравнивает число вычислений модели, а не задержку сервиса, поэтому последовательную часть каскада придётся профилировать на целевом оборудовании.
Менять архитектуру продукта ради Self-Repulsion оснований пока нет. Но для уже работающего ансамбля диффузионной модели это небольшой эксперимент с понятным критерием успеха: при том же бюджете правильный ответ должен чаще попадать в набор, а голосование — не терять способность его распознавать.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



