Журнал · Rit.work

LLM-судья может стабильно ставить неверные баллы

Повторяемые оценки локальной LLM не гарантируют согласия с людьми, поэтому автоматического судью нужно проверять сразу по нескольким метрикам.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Локальная LLM может раз за разом выставлять один и тот же балл, но слабо совпадать с оценками людей. В препринте IIT Kharagpur, который не прошёл рецензирование и содержит замеры самого автора, LLaMA-3-8B повторила точную оценку в 97,3% случаев, хотя её корреляция Пирсона с человеческими баллами составила 0,275. Поэтому повторяемость нельзя использовать как единственную проверку автоматического судьи.

Для эксперимента взяли 300 ответов модели GPT-2, дообученной выполнять инструкции. Ответы охватывали фактические знания, следование инструкциям, математику, рассуждения и письмо. Каждый ответ независимо оценили девять человек, а LLaMA-3-8B и Qwen2.5-7B трижды выставили ему балл по общей рубрике: правильность, релевантность, полнота, ясность и соблюдение требований.

Qwen2.5-7B совпадала с людьми лучше, хотя повторяла собственные баллы реже. Её средняя абсолютная ошибка — среднее расхождение с человеческой оценкой — составила 18,64 балла против 27,71 у LLaMA-3-8B. Связь с человеческими оценками также менялась между категориями заданий и способами генерации ответов.

При выборе LLM-судьи нужно отдельно измерять стабильность и согласие с контрольной человеческой разметкой. Корреляция Пирсона показывает, меняются ли баллы модели вместе с человеческими; ранговая корреляция проверяет порядок ответов; средняя абсолютная ошибка — размер расхождения; знаковое смещение — склонность систематически завышать или занижать оценки.

Эти метрики стоит пересчитывать на том же наборе задач, рубрике и типах ответов, которые встретятся в продукте. Работа охватывает только две локальные модели-судьи и ответы одной небольшой генеративной модели, поэтому её числа не описывают все модели и сценарии. Но сам разрыв между повторяемостью и согласием с людьми показывает, почему стабильный балл ещё не подтверждает качество оценки.

Источники

Иллюстрация: рисунок из статьи «When Consistency Does Not Mean Reliability: Evaluating Local LLM Judges Against Human Ratings», Aakash Kumar Tiwari, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу