Журнал · Rit.work

Cliff учит LLM на границе первой ошибки

Cliff превращает первую ошибку в рассуждении LLM в обучающий сигнал и по замерам авторов превосходит стандартный GRPO на 7%.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Peixuan Han и соавторы из Amazon Web Services и University of Illinois Urbana-Champaign представили Cliff — стратегию формирования награды для дообучения LLM, описанную в препринте, не проходившем рецензирования. В среднем по замерам авторов Cliff превзошёл стандартный GRPO на 7%. Работа важна командам, которые обучают модели решать задачи с автоматически проверяемым результатом.

Что сделали

Cliff расширяет обучение с подкреплением и проверяемой наградой (RLVR): подход, при котором ответ модели получает оценку через автоматическую проверку. Обычно алгоритм GRPO назначает всей траектории ответа (rollout) одну награду за конечный результат, поэтому почти верное решение и рассуждение с ошибкой в начале получают одинаковый отрицательный сигнал.

Авторы поручают LLM-учителю найти первый ошибочный шаг. Перед ним остаётся корректный префикс, после него — ошибочный суффикс. Эта граница преобразуется в преимущества на уровне токенов — относительные веса, определяющие, какие части ответа алгоритм должен сохранять, а какие подавлять. В основной конфигурации корректный префикс ошибочного ответа не получает дополнительного положительного подкрепления, зато избегает отрицательной оценки, назначенной суффиксу.

Учитель сначала самостоятельно решает задачу. Если автоматический проверяющий подтверждает его ответ, модель оценивает рассуждение ученика; иначе обучение возвращается к обычному GRPO. Такой фильтр позволяет использовать готовую LLM вместо отдельной модели награды.

Что это значит

Cliff предлагает промежуточный вариант между наградой только за итог и оценкой каждого шага: для обучающего сигнала достаточно одной границы. Это снижает требования к совпадению способов рассуждения учителя и ученика, характерному для дистилляции на собственных траекториях, но добавляет вызовы учителя при обучении.

Ограничения. Авторы проверяли подход на двух моделях-учениках, в математических задачах и программировании, всего в 12 сценариях. Проверка качества поиска первой ошибки человеком проводилась только на небольшой сбалансированной выборке из DAPO-Math. Работа не показывает перенос результата на агентные процессы; сравнения с основанным на правилах поиском первой ошибки также нет — это направление авторы оставили для будущей работы.

Источники

Иллюстрация: рисунок из статьи «Cliff: Learning Process Rewards from the First Mistake», Peixuan Han, Runhui Wang, Ketan Ramaneti и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу