Журнал · Rit.work

У LLM измерили сужение разнообразия продолжений

Авторы сравнили разнообразие продолжений LLM с обучающими данными и предложили постфактум перераспределять веса уже созданных вариантов.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Youqi Wu и Farzan Farnia исследовали, воспроизводят ли генеративные модели разнообразие обучающих данных, в препринте, который не проходил рецензирования. Для OLMo жадное декодирование дало примерно на 35% меньше условно различимых продолжений: 219 против 339 у корпуса. Работа важна командам, которым от модели нужен набор разных допустимых вариантов, а не один наиболее вероятный ответ.

Что сделали

Авторы измеряли условную энтропию — неопределённость в продолжении, которая остаётся после учёта исходного префикса. Её матрический вариант позволяет работать с парами «префикс — продолжение», не требуя нескольких эталонных ответов для одного запроса. Экспонента этой метрики интерпретируется как эффективное количество условно различимых выходов.

На выборке из 20 000 пар авторы сопоставили фрагменты обучающих корпусов с продолжениями OLMo, Pythia и GPT-Neo. При жадном декодировании, выборке из ограниченного вероятностного ядра и обычной случайной выборке модели показывали меньшую условную энтропию, чем данные. Такой же порядок авторы получили для генераторов изображений на ImageNet и MS-COCO.

Для коррекции предложено создавать несколько кандидатов на каждый вход и постфактум перераспределять их веса. Оптимизация повышает условную энтропию, сохраняет распределение входов и ограничивает отклонение от исходной выдачи. Новые варианты метод не создаёт и переобучения модели не требует.

Что это значит

Выбор более случайного способа декодирования сокращал разрыв, но не устранял его. Для продукта это разделяет две задачи: генерацию достаточного набора кандидатов и выбор между ними. Предложенная коррекция применима ко второй задаче — например, при формировании нескольких формулировок или сводок, — если подходящие редкие варианты уже присутствуют среди кандидатов.

Ограничения. Работа не устанавливает причину сужения разнообразия и не показывает, как метрика связана с пользой в производственных сценариях. Прямое сравнение текста ограничено тремя открытыми семействами, доступными или восстанавливаемыми обучающими корпусами и короткими продолжениями; основной замер проведён на 20 000 парах. В сравнении нет закрытых LLM, а коррекция проверяется только на заранее созданном наборе кандидатов, поэтому результат не переносится автоматически на ответы, которых модель вообще не сгенерировала.

Источники

Иллюстрация: рисунок из статьи «Do Large Language Models Capture the Diversity in their Training Data?», Youqi Wu, Farzan Farnia, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу