Журнал · Rit.work

Уверенность CLM откалибровали, но каскад почти не сэкономил вызовы

CLM-v0.1-8B стабильно оценивает ответы независимо от их порядка, но уступает моделям того же размера и почти всегда передаёт решение Qwen3-32B.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Проверка показала, что открытая CLM-v0.1-8B как модель-оценщик работает близко к случайному выбору на сложных публичных тестах. В препринте независимого исследователя Gowthamkumar Nandakishore, который не прошёл рецензирование и содержит замеры самого автора, каскад передавал сильной модели от 92,3% до 100% заданий, чтобы сохранить не менее 97% её качества. Такой каскад почти не сокращает число дорогих вызовов.

CLM не генерирует разбор ответа: она независимо сопоставляет каждый вариант с запросом по близости векторов и выбирает лучший. Исследователь проверил исходную модель без дополнительного обучения, откалибровал её уверенность на отдельной части данных, а затем использовал эту уверенность как порог для передачи сложных случаев Qwen3-32B.

На трёх тестах CLM превысила простые случайные ориентиры, но на RM-Bench и JudgeBench разница с подбрасыванием монеты осталась в пределах погрешности. На HaluEval модель выдала одну и ту же метку для всех примеров и повторила результат правила «всегда выбирать первый вариант». Qwen3-8B и Skywork-Reward-V2-8B того же размера обошли CLM на 13,6–52,5 процентного пункта; все такие разрывы статистически значимы.

Калибровка исправила форму уверенности, но не качество решений. До неё CLM завышала вероятность верного ответа на 23,5–40,1 процентного пункта; после настройки ошибка калибровки, то есть разрыв между уверенностью и долей верных ответов, не превышала 6,2%. При этом CLM почти не меняла решение после перестановки ответов: 0,02% случаев против 21,88% у Qwen3-8B. Это полезное свойство архитектуры, но оно не компенсирует низкую точность.

Проверка охватила одну модель CLM, пять публичных тестов предпочтений и HaluEval с готовыми метками. Её сравнивали с генеративной моделью, моделью вознаграждения и простыми правилами; для каскада использовали Qwen3-32B через Amazon Bedrock. В RewardBench 2 окно CLM обрезало часть текста у большинства примеров, поэтому результаты относятся именно к этой конфигурации и политике сокращения входа.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу