Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Вклад каждого токена в итоговую награду LLM можно определить однозначно, если потребовать от него трёх естественных свойств. В работе Jiayan Fu и коллег метод PACT достиг средней точности 72,87% на задачах по математике, хотя препринт не прошёл рецензирование и содержит собственные замеры авторов. Для команд, которые обучают агентов по итоговой награде, работа предлагает конкретное изменение: сначала обновлять модель, затем подстраивать под неё критика.
Как измерили вклад отдельного токена
При обучении с подкреплением модель генерирует длинную последовательность, взаимодействует с инструментами и получает награду только в конце. Обновлять при этом нужно вероятности отдельных токенов, поэтому итоговый успех или неудачу приходится распределять по всей траектории.
PACT начинает с условного прогноза награды. До очередного токена система оценивает ожидаемый итог по уже известной истории, а после токена и ответа среды пересчитывает прогноз. Разность этих двух оценок и есть вклад токена:
вклад токена = новый прогноз награды − предыдущий прогноз
Такое определение следует из трёх требований. Полнота требует, чтобы сумма вкладов объясняла разницу между фактической наградой и её начальным прогнозом. Согласованность префикса запрещает менять вклад уже сгенерированной части после появления продолжения. Нейтральность требует, чтобы ожидаемый вклад следующего токена до его генерации равнялся нулю.
Вместе эти требования оставляют единственный вариант распределения награды. Наблюдения среды входят в доступную модели информацию и меняют прогноз, но вклад относят только к сгенерированным токенам. Если нужна оценка целого шага агента или реплики, вклады соседних токенов можно сложить.
Эта формализация также объясняет поведение существующих методов. Идеальный учитель в On-Policy Distillation играет роль неявного критика. RLOO использует одну оценку для всего ответа, но в среднем создаёт тот же вклад в градиент политики, что и поточечное распределение награды. Равенство выполняется только в среднем: шум конечных исходов у RLOO остаётся.
Почему критик отстаёт от модели
Критик — отдельная часть системы, которая по текущей истории предсказывает будущую награду. Актёр выбирает следующие токены. Чтобы разность соседних прогнозов отражала вклад токена, критик должен оценивать именно ту политику, которой сейчас следует актёр.
В обычной схеме PPO критик выдаёт оценки до обновления актёра. Затем актёр меняется, а критика обучают на траекториях прежней политики. На следующем цикле он снова оказывается на один шаг позади, и ошибка между соседними прогнозами может оказаться сопоставима с полезным сигналом.
Проблема усиливается на длинных траекториях. При ограниченной итоговой награде сумма квадратов вкладов также ограничена, поэтому заметные изменения прогноза встречаются редко. В обобщённой оценке преимущества GAE промежуточные ошибки критика тогда способны перекрыть небольшие локальные вклады. PACT устраняет промежуточные ошибки выбором предельного коэффициента накопления, при котором остаётся только ошибка прогноза для текущего префикса.
PACT меняет порядок: сначала обновляет актёра, затем повторно прогоняет тот же пакет через обновлённую модель и обучает критика. Чтобы старые траектории соответствовали новой политике, цели перевзвешивают по изменению вероятностей токенов. Метод также заменяет среднеквадратичную ошибку критика на бинарную перекрёстную энтропию BCE, не меняя при этом целевой условный прогноз награды.
Когда PACT стоит включить в план экспериментов
На четырёх математических наборах PACT получил среднюю точность 72,87%: на 8,80 процентного пункта выше GRPO и на 13,16 пункта выше PPO. На SWE-bench Verified доля решённых задач составила 67,4%, что на 2 пункта выше GRPO.
Математические эксперименты проводили с Qwen3.5-4B, агентной оболочкой OpenCode и проверкой конечного ответа. Кодовые задачи запускали с Qwen3.6-35B-A3B и терминальной проверкой результата. Сравнение охватывает PPO, GRPO и SAO, но только эти две модели и два типа задач с итоговой наградой.
Работа не требует пересматривать системы, где GRPO уже даёт приемлемый результат без критика. Она меняет план для команд, которые используют PPO-подобное обучение длинных агентных траекторий: порядок «актёр, затем критик», BCE и коррекция по новой политике можно проверить как единый вариант вместо настройки критика в прежней схеме.
Практическая реализация отличается от точной математической конструкции. Полное отношение вероятностей продолжения слишком шумно на длинных ответах, поэтому PACT берёт отношение только для текущего токена и отбрасывает крайние значения. Для этого нужен дополнительный прямой проход модели, но не требуется генерировать новые траектории. Именно стоимость такого прохода и прирост на собственных задачах определят, стоит ли переносить схему в производственное обучение.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



