Журнал · Rit.work

DAST разводит ответы LLM, не меняя их вероятности

Перестановка словаря помогает модели реже повторять одну и ту же мысль при пакетной генерации, почти не замедляя вывод.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научились выдавать менее похожие варианты одного ответа без изменения вероятности каждого отдельного результата. Ryoma Sato из National Institute of Informatics представил DAST: на ProtoQA метод прибавил до 0,33 процентного пункта к арифметической выборке, хотя препринт не рецензирован, а числа получил сам автор. Для систем, которые генерируют несколько кандидатов, разнообразие теперь можно повышать на уровне выборки токенов, не переобучая модель.

Как порядок токенов влияет на разные ответы

Обычная генерация независимо выбирает каждый вариант. Поэтому несколько запусков могут попасть в одну область распределения и выдать одинаковые или близкие ответы: смена случайного начального значения этого не предотвращает.

Арифметическая выборка распределяет позиции кандидатов равномерно по интервалу вероятностей. Если модель одновременно строит несколько ответов, их позиции не скапливаются рядом. При этом положение каждого отдельного кандидата остаётся равномерно случайным, поэтому его распределение вероятностей не меняется.

Проблема скрывается в порядке словаря. Идентификаторы токенов обычно не отражают смысл: Christmas и christmas, формы единственного и множественного числа или синонимы могут находиться далеко друг от друга. Равномерно разнесённые позиции тогда выбирают разные токены, но не разные идеи.

DAST заранее выстраивает токены по их векторным представлениям так, чтобы близкие по смыслу оказались рядом. Для этого метод строит начальный маршрут через словарь, а затем сокращает расстояние между соседями алгоритмом 2-OPT. При выборке близкие токены занимают общий участок интервала, поэтому разнесённые кандидаты реже захватывают несколько вариантов одной мысли.

Модель и вероятности токенов при этом не меняются. DAST лишь задаёт другой порядок, в котором выборщик раскладывает их по интервалу, а после возвращает исходные идентификаторы. Подготовка порядка заняла до 228 секунд на модель, после чего его можно использовать во всех запросах; добавка при генерации составила около 2 микросекунд на токен.

У метода есть и формальная гарантия: если некоторый ответ имеет ненулевую вероятность, при достаточно большом пакете арифметическая выборка обязательно захватит его интервал. Для редкой последовательности нужный пакет может оказаться непрактично большим, поэтому эта гарантия объясняет механизм, но не обещает найти любой ответ за разумное время.

Разница проявилась на ответах без единственного правильного варианта

Метод проверили на четырёх инструкционных моделях семейств SmolLM2 и Qwen2.5, крупнейшая из которых содержит семь миллиардов параметров. Их сравнили с независимой случайной и обычной арифметической выборкой.

Основным тестом стал ProtoQA — набор бытовых вопросов, на которые люди дают несколько допустимых ответов. Оценка растёт, когда пакет из трёх генераций покрывает разные популярные варианты, и не начисляет дополнительные баллы за повторы.

DAST и обычная арифметическая выборка обошли независимую генерацию на 2–4 процентных пункта. Перестановка словаря добавила к арифметической выборке ещё до 0,33 процентного пункта; для двух младших моделей Qwen разница вышла за пределы статистической погрешности.

Показателен пример с вопросом о дне, когда люди чаще звонят домой. Обычный порядок дал начала Christmas, christmas и Halloween. После перестановки две записи Рождества оказались рядом, и модель начала ответы со значений christmas, Thanksgiving и Mother.

Вывод относится к пакетной генерации авторегрессионными моделями и к задаче, где ценится охват разных допустимых ответов. Сохранение распределения гарантируется для каждого кандидата отдельно: ответы внутри пакета намеренно зависят друг от друга, поскольку именно эта связь разводит их по разным областям.

Когда DAST меняет план внедрения

Работа не даёт причины менять выбранную модель или запускать новое обучение. Она добавляет вариант для слоя генерации, если продукт строит несколько кандидатов и затем выбирает один: идеи для оператора, решения с автоматической проверкой, ответы для ранжирования или примеры для обучения с проверяемой наградой.

Внедрение требует доступа к входным векторным представлениям модели и к механизму выборки токенов. Порядок нужно подготовить отдельно для каждой модели, поскольку словари и представления различаются. После обновления модели подготовку придётся повторить, а для исследованных конфигураций готовый порядок можно хранить рядом с весами.

Наиболее осторожный план — оставить текущую модель и сравнить DAST с действующей выборкой на прикладной метрике: доле пакетов, где найден хотя бы один полезный кандидат, или охвате разных корректных вариантов. Прирост над обычной арифметической выборкой на ProtoQA невелик, поэтому ценность определит стоимость повторов в конкретном продукте, а не сам факт большей лексической разницы.

Если система возвращает один ответ, преимущество исчезает: распределение отдельной генерации остаётся прежним. Метод также не подходит там, где кандидаты должны быть статистически независимыми. Для остальных пакетных сценариев DAST позволяет сначала оптимизировать выборку и только затем решать, нужны ли более дорогая модель, повышение температуры или дополнительное обучение.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу