Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Языковую модель научили выдавать варианты с заданными частотами, а не только верно описывать эти частоты. На задачах с урнами и опросами обучение убрало 80–92% лишней ошибки, хотя препринт New York University и Carnegie Mellon University не прошёл рецензирование и все числа получили сами авторы. Для продуктов с синтетическими респондентами и управляемой генерацией это превращает соответствие распределению в отдельную задачу обучения.
Почему общая награда не обучает GRPO
Обычная LLM может правильно прочитать условие вроде «орёл выпадает редко», но генерировать орла гораздо чаще. Ошибка возникает уже в вероятностях следующих токенов, поэтому смена температуры или другого правила выбора токенов исправляет её лишь частично.
GRPO обучает модель на группах ответов. Для каждого запроса он генерирует несколько вариантов, назначает им награды, вычитает среднюю награду группы и повышает вероятность ответов с положительным остатком. Если оценить распределение всей группы и дать каждому ответу одинаковую награду, после вычитания среднего все остатки станут нулевыми.
Разделение ответов на несколько подгрупп не решает основную проблему. Такая награда оценивает, насколько случайная конечная выборка похожа на цель, а не насколько с ней совпадают вероятности самой модели. Она также склонна игнорировать исходы, которые должны встречаться редко и могут не попасть в небольшую группу.
Для оценки используют расстояние полной вариации: оно показывает наибольшую разницу между вероятностями, которые два распределения назначают одному набору исходов. Из результата вычитают ошибку, которую дала бы конечная выборка идеального генератора. Получается лишняя ошибка, связанная именно с моделью.
Каждый ответ получает награду за свою частоту
Предложенная награда опирается на максимальное расхождение средних (MMD). Для конечного набора вариантов оно сводится к разнице между вероятностью исхода у модели и его целевой вероятностью. Полученная функция показывает, какие варианты модель производит слишком часто, а какие — слишком редко.
Каждый ответ получает удвоенную разницу между целевой вероятностью своего исхода и частотой этого исхода среди остальных ответов группы. Редкий относительно цели вариант получает положительную награду, слишком частый — отрицательную. Текущий ответ исключают из подсчёта, иначе он искусственно повышает собственную частоту и подталкивает модель концентрировать вероятность на меньшем числе вариантов.
Такой сигнал авторы называют witness advantage. После него GRPO по-прежнему вычитает среднее группы, но награды уже различаются между исходами и не исчезают. В среднем обновление уменьшает квадрат расхождения между вероятностями модели и целевым распределением.
На примере монеты с целевой вероятностью орла 0,005 исходная модель назначала орлу вероятность 0,678. После обучения она снизилась до 0,041. Лучший вариант без обучения убрал только 19% ошибки, поскольку настройка выбора токенов не меняет неверные внутренние вероятности.
Знак ошибки без её величины работал на обычных распределениях почти так же, но ломался на Zipf: там много редких исходов, для которых важно знать размер отклонения. Полная награда продолжала корректировать их вероятность, а простой сигнал «слишком часто или слишком редко» переставал вести к цели.
Проверка охватывает Qwen2.5-1.5B-Instruct, синтетические распределения с новыми параметрами и семействами, распределения ответов на опросы, выбор шаров из урны и пары родственников в структурированном выводе. Обучение переносилось на задачу NYTimes, которой не было в обучающем наборе. На прикладных задачах результат стоил модели 2,1 пункта MMLU, тогда как изменение IFEval осталось в пределах погрешности.
Метод меняет планы только для управляемой случайности
Работа касается систем, где один запрос должен давать разные допустимые ответы с заранее известными частотами. Сюда относятся синтетические респонденты, моделирование действий по заданной политике и генерация категориальных данных. Для классификатора, которому нужен один наиболее вероятный ответ, такая настройка не даёт отдельной пользы.
Команде понадобятся целевое распределение, конечный набор исходов и однозначный разбор ответа модели. После каждой группы генераций достаточно посчитать исходы и передать их частоты в награду GRPO. Отдельная модель-оценщик не нужна: сигнал вычисляется из целевых вероятностей и ответов самой группы.
Главный практический вывод относится не только к распределениям. Если качество определяется набором ответов, общей оценки набора недостаточно: алгоритму нужно объяснить вклад каждого ответа в ошибку. Иначе центрирование наград может полностью удалить обучающий сигнал или направить оптимизацию к свойствам конечной выборки вместо поведения модели.
Эксперименты ограничены конечными перечислимыми исходами, где совпадение можно проверить напрямую. Для свободного текста потребуется функция сходства между ответами и представление целевого распределения примерами; такой вариант в работе описан как следующий шаг, но не проверен.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



