Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Xinning Li и соавторы представили EvalDetectBench — открытый набор данных и конвейер для измерения способности LLM распознавать проверку, хотя работа пока опубликована как нерецензированный препринт. По замерам авторов, модель, создавшая диалог для сравнения, объясняет 11,25% разброса оценок и способна изменить рейтинг проверяемых моделей. Это важно командам, которые используют результаты испытаний для допуска моделей к продуктам или обоснования их безопасности.
Что сделали
EvalDetectBench предлагает модели-оценщику отличить записи испытаний от диалогов, собранных в условиях практического использования. Для каждой модели авторы отдельно подбирают до пяти закрытых вопросов: единый набор формулировок не переносится между семействами и может занижать результат на 0,08 AUROC. AUROC здесь показывает, насколько хорошо модель ранжирует записи двух классов: 0,5 соответствует случайному угадыванию, 1 — безошибочному разделению.
Второе изменение касается происхождения диалогов. Стиль модели, создавшей запись, может выглядеть для оценщика более или менее похожим на испытание независимо от содержания задачи. Авторы предлагают брать рабочие диалоги того же семейства, что и модель-оценщик, либо корректировать оценки по семейству генератора и типу взаимодействия. Конвейер совместим с испытаниями на платформе Inspect, поэтому состав задач и записей можно заменять.
Что это значит
Работа показывает, что измерение «осведомлённости о проверке» зависит не только от проверяемой модели. Если контрольные вопросы подобраны на другом семействе, а рабочие записи созданы несбалансированным набором моделей, итоговый рейтинг может отражать устройство испытания. Для внедрения это означает, что показатель следует рассчитывать на данных, близких к предполагаемому сценарию эксплуатации, и публиковать вместе с методикой отбора вопросов и диалогов.
Ограничения. Авторы проверяли подход на наборе из 746 записей, 12 моделях-оценщиках и 13 испытаниях. Рабочая часть набора собрана из публичных источников и может не соответствовать трафику конкретного продукта. Метод измеряет способность распознать проверку после прямого вопроса, но не показывает, станет ли модель самостоятельно искать такие признаки, изменит ли поведение и ответит ли честно. Предложенную коррекцию сравнивали с диалогами того же семейства, однако сами авторы считают такой ориентир несовершенным; сопоставления с методом, который не задаёт модели вопрос напрямую, в работе нет.
Источники
Иллюстрация: рисунок из статьи «EvalDetectBench: A Benchmark for Measuring Evaluation Awareness in Frontier Language Models», Xinning Li, Kemunto Ochwang'i, Aryasomayajula Ram Bharadwaj и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



