Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Обучение классификатора становится точнее, если каждый шаг учитывает, сколько обучения осталось, а не только ближайший прирост. Хотя препринт Google DeepMind не рецензирован и все числа в нём получили сами авторы, на ImageNet такой подход повысил точность top-1 на 1,0–2,4 процентного пункта относительно перекрёстной энтропии. Для постобучения LLM это задаёт новую гипотезу о распределении вычислений, но пока не даёт готовой замены существующим алгоритмам.
Почему точный градиент точности выбирает не те примеры
Классификатор можно представить как стратегию: он назначает вероятности классам и получает награду, если выбирает правильный. Тогда ожидаемая точность — это средняя вероятность, которую модель назначает правильному классу. Поскольку правильная метка известна, градиент стратегии (policy gradient) можно вычислить точно, без выбора случайного действия.
Такой градиент отвечает на узкий вопрос: какой небольшой сдвиг сильнее всего повысит точность прямо сейчас. Он предпочитает примеры, где модель уже близка к границе решения, потому что там малое изменение оценки класса быстрее меняет вероятность ответа.
Но обучение состоит из последовательности шагов. Трудный пример сначала почти не даёт прироста, зато после нескольких обновлений может перейти в область, где модель учится на нём быстро. Если шагов осталось много, вложиться в него выгоднее, чем дополнительно улучшать почти решённый пример.
На ResNet-50 при общей скорости обучения точный градиент достиг ожидаемой точности 4,2%, тогда как перекрёстная энтропия — 62%. Разрыв возник в задаче без исследования среды, отложенной награды и случайного выбора действий, которыми обычно объясняют нестабильность обучения с подкреплением.
Перекрёстная энтропия смотрит дальше. Она назначает примеру вес по всей ошибке, которую ещё можно устранить, как будто обучение будет продолжаться без ограничения. Это помогает в начале, но ближе к концу заставляет тратить обновления на примеры, которые уже невозможно исправить за оставшееся время.
Как функция потерь горизонта учитывает оставшийся бюджет
Функция потерь горизонта (horizon loss) оценивает не мгновенный прирост и не весь теоретически доступный прирост, а улучшение, достижимое до конца запуска. Для этого она умножает оставшуюся ошибку примера на оценку вероятности исправить его в пределах доступного бюджета.
Сам бюджет приближают суммой будущих скоростей обучения и переводят в изменение оценок классов с помощью одного калибровочного коэффициента. В начале горизонт велик, поэтому функция ведёт себя почти как перекрёстная энтропия. К концу он сокращается, и обновления приближаются к точному градиенту ожидаемой точности.
Метод проверили на MNIST с многослойной сетью и на ImageNet с ResNet-50, ResNet-101 и ViT-S/16. Модели ImageNet обучали 30 эпох; внутри каждого режима меняли только функцию потерь. Основные опыты использовали постоянную скорость обучения, а дополнительные — её косинусное снижение.
При постоянной скорости функция потерь горизонта улучшила точность top-1 — долю изображений, где правильный класс оказался первым, — на всех проверенных моделях. При косинусном снижении преимущество сохранилось, но стало меньше: такой график сам уменьшает размер поздних обновлений и частично воспроизводит нужный эффект.
Преимущество росло при случайной замене меток. Перекрёстная энтропия продолжала активно обучаться на испорченных примерах, а сокращающийся горизонт постепенно исключал те, которые уже нельзя было исправить. Постоянный или растущий горизонт такого результата не дал.
Подход применили и к самой перекрёстной энтропии. Её запланированная версия снизила отрицательную логарифмическую правдоподобность на ImageNet с 1,467 до 1,364. При этом улучшения зависели от целевой метрики: функция для точности ухудшала вероятностную оценку, а функция для правдоподобия могла ухудшить ожидаемую точность.
Для LLM это план эксперимента, а не смена стека
Связь с постобучением LLM следует из того же распределения веса. При бинарной награде градиент стратегии сильнее обновляет запросы, на которых вероятность успеха уже находится в удобной для обучения области. Он не учитывает, сколько вычислений осталось и можно ли успеть улучшить более трудный запрос.
Эксперименты охватывают классификацию с известными метками, где можно точно просуммировать результаты по всем классам. В постобучении LLM модель видит награду лишь для выбранного ответа, а вероятность будущего успеха приходится оценивать по неполной обратной связи. Возвращаются исследование вариантов, распределение награды между действиями и шум выборки.
Поэтому менять GRPO или другой алгоритм на функцию потерь горизонта рано. Практический следующий шаг — проверить в контролируемом запуске, помогает ли постепенный переход от более «терпеливого» веса к непосредственной награде в конце обучения. Особенно содержателен режим с фиксированным бюджетом вычислений, где можно отдельно сравнить постоянный, растущий и сокращающийся горизонты.
Для классификаторов вывод применим уже сейчас, но требует собственной настройки. Коэффициент горизонта в опытах выбирали по тестовой точности без отдельной проверочной выборки, поэтому перед внедрением его нужно подбирать на проверочных данных и сравнивать при неизменных оптимизаторе, скорости обучения и числе шагов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



