Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Youqi Wu и Farzan Farnia исследовали, воспроизводят ли генеративные модели разнообразие обучающих данных, в препринте, который не проходил рецензирования. Для OLMo жадное декодирование дало примерно на 35% меньше условно различимых продолжений: 219 против 339 у корпуса. Работа важна командам, которым от модели нужен набор разных допустимых вариантов, а не один наиболее вероятный ответ.
Что сделали
Авторы измеряли условную энтропию — неопределённость в продолжении, которая остаётся после учёта исходного префикса. Её матрический вариант позволяет работать с парами «префикс — продолжение», не требуя нескольких эталонных ответов для одного запроса. Экспонента этой метрики интерпретируется как эффективное количество условно различимых выходов.
На выборке из 20 000 пар авторы сопоставили фрагменты обучающих корпусов с продолжениями OLMo, Pythia и GPT-Neo. При жадном декодировании, выборке из ограниченного вероятностного ядра и обычной случайной выборке модели показывали меньшую условную энтропию, чем данные. Такой же порядок авторы получили для генераторов изображений на ImageNet и MS-COCO.
Для коррекции предложено создавать несколько кандидатов на каждый вход и постфактум перераспределять их веса. Оптимизация повышает условную энтропию, сохраняет распределение входов и ограничивает отклонение от исходной выдачи. Новые варианты метод не создаёт и переобучения модели не требует.
Что это значит
Выбор более случайного способа декодирования сокращал разрыв, но не устранял его. Для продукта это разделяет две задачи: генерацию достаточного набора кандидатов и выбор между ними. Предложенная коррекция применима ко второй задаче — например, при формировании нескольких формулировок или сводок, — если подходящие редкие варианты уже присутствуют среди кандидатов.
Ограничения. Работа не устанавливает причину сужения разнообразия и не показывает, как метрика связана с пользой в производственных сценариях. Прямое сравнение текста ограничено тремя открытыми семействами, доступными или восстанавливаемыми обучающими корпусами и короткими продолжениями; основной замер проведён на 20 000 парах. В сравнении нет закрытых LLM, а коррекция проверяется только на заранее созданном наборе кандидатов, поэтому результат не переносится автоматически на ответы, которых модель вообще не сгенерировала.
Источники
Иллюстрация: рисунок из статьи «Do Large Language Models Capture the Diversity in their Training Data?», Youqi Wu, Farzan Farnia, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



