Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Проверка показала, что открытая CLM-v0.1-8B как модель-оценщик работает близко к случайному выбору на сложных публичных тестах. В препринте независимого исследователя Gowthamkumar Nandakishore, который не прошёл рецензирование и содержит замеры самого автора, каскад передавал сильной модели от 92,3% до 100% заданий, чтобы сохранить не менее 97% её качества. Такой каскад почти не сокращает число дорогих вызовов.
CLM не генерирует разбор ответа: она независимо сопоставляет каждый вариант с запросом по близости векторов и выбирает лучший. Исследователь проверил исходную модель без дополнительного обучения, откалибровал её уверенность на отдельной части данных, а затем использовал эту уверенность как порог для передачи сложных случаев Qwen3-32B.
На трёх тестах CLM превысила простые случайные ориентиры, но на RM-Bench и JudgeBench разница с подбрасыванием монеты осталась в пределах погрешности. На HaluEval модель выдала одну и ту же метку для всех примеров и повторила результат правила «всегда выбирать первый вариант». Qwen3-8B и Skywork-Reward-V2-8B того же размера обошли CLM на 13,6–52,5 процентного пункта; все такие разрывы статистически значимы.
Калибровка исправила форму уверенности, но не качество решений. До неё CLM завышала вероятность верного ответа на 23,5–40,1 процентного пункта; после настройки ошибка калибровки, то есть разрыв между уверенностью и долей верных ответов, не превышала 6,2%. При этом CLM почти не меняла решение после перестановки ответов: 0,02% случаев против 21,88% у Qwen3-8B. Это полезное свойство архитектуры, но оно не компенсирует низкую точность.
Проверка охватила одну модель CLM, пять публичных тестов предпочтений и HaluEval с готовыми метками. Её сравнивали с генеративной моделью, моделью вознаграждения и простыми правилами; для каскада использовали Qwen3-32B через Amazon Bedrock. В RewardBench 2 окно CLM обрезало часть текста у большинства примеров, поэтому результаты относятся именно к этой конфигурации и политике сокращения входа.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



