Журнал · Rit.work

Подробные метрики снижают надёжность повторных тестов

Многокритериальная обратная связь помогает подобрать модель под случайные особенности теста: в эксперименте доля ложных победителей почти удвоилась.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Подробные результаты по отдельным задачам позволяют разработчикам подстроить модель под скрытый тест, даже если его примеры не раскрывают. Youssef Allouah и John Duchi показали это на теории и контролируемых атаках, хотя препринт не рецензировали и числа в нём получили сами авторы. При многокритериальной обратной связи ложными оказались 95,2% победителей против 48,5% при публикации одной сводной оценки.

Авторы рассмотрели бенчмарк, к которому разработчики возвращаются после каждого изменения модели. Если площадка показывает только новый рекорд по одной оценке, из теста утекает мало информации. Если она публикует результаты по задачам или набор моделей, которые лидируют при разных сочетаниях критериев, почти каждая попытка может открыть новую случайную особенность тестовой выборки.

Теоретическая граница зависит не только от числа попыток, но и от числа критериев. При фиксированном наборе критериев необходимый объём теста растёт логарифмически вместе с числом адаптивно выбранных моделей. Когда число критериев растёт логарифмически, объём теста в худшем случае уже должен расти линейно: правило «публиковать только убедительные улучшения» перестаёт защищать от подгонки.

Эффект проверили на четырёх сохранённых версиях многозадачных LLM-бенчмарков. Атака создавала маршрутизаторы запросов между двумя моделями, использовала опубликованные результаты и затем объединяла удачные варианты. Разрыв между повторно использованной и отложенной выборками составил в среднем 8,36 процентного пункта при публикации профилей по задачам и 4,14 пункта при одной сводной оценке.

Это контролируемая атака, а не наблюдение за обычной разработкой, поэтому работа не показывает, как часто такой сценарий возникает сам. Но для собственной системы оценки следствие практическое: подробные профили нельзя считать столь же безопасными для многократного выбора модели, как одну заранее заданную метрику. Финального кандидата стоит проверять на свежей отложенной выборке, которая не участвовала в цикле разработки.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу