Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Выборочную проверку качества можно довести до заданной надёжности, не отправляя каждую оценку LLM человеку. В препринте Dae Woong Ham, Xuejun Zhao, Stefanus Jasin и Fenghua Yang, который не проходил рецензирование, а все числа получили сами авторы, гибридная схема снизила затраты до 39,16% относительно более дешёвой проверки только человеком или только ИИ. Для команд это вариант архитектуры, где модель-оценщик собирает доказательства, а человек подключается только тогда, когда его ответ оправдывает цену.
Как SCALE выбирает источник следующей оценки
Работа рассматривает проверку доли объектов с бинарной меткой. Например, команда может выяснять, превышает ли доля корректных программ заданный порог или остаётся ли доля опасных ответов ниже допустимого уровня.
Для проверки задают две гипотезы: доля положительных меток равна нижнему значению p0 или верхнему p1. Ошибка первого рода означает, что система выбрала p1, хотя верно p0; ошибка второго рода — обратное решение. Допустимый риск каждой ошибки задают заранее.
Истинную метку открывает человек. LLM возвращает более дешёвый, но потенциально ошибочный отчёт: это может быть метка, оценка уверенности или конечный набор других сигналов. В стоимость входят получение объекта, запрос к модели и работа человека.
SCALE накапливает свидетельства в пользу одной из гипотез и после каждого объекта решает, что делать дальше. Система может сразу запросить человека, ограничиться оценкой ИИ либо сначала получить её и затем передать тот же объект человеку. Она прекращает проверку, когда доказательств хватает для решения с заданным риском ошибки.
Ключевая деталь — решение об эскалации зависит не только от неуверенности модели. Оно учитывает конкретный отчёт ИИ, уже накопленные свидетельства и цену дополнительной информации. Если отчёт почти ничего не оставляет для уточнения, человеческая проверка малоценна; неоднозначный отчёт может оправдать её даже при высокой стоимости.
Пул объектов выбирают заранее, хотя оценки внутри него запрашивают адаптивно. Если граница решения не достигнута до исчерпания пула, SCALE запускает заранее заданную резервную проверку. За счёт неё ограничения на оба вида ошибок действуют и при конечном размере выборки, а не только в предельном режиме.
Когда гибридная схема экономит больше всего
Сначала работа выводит нижнюю границу затрат: сколько в принципе должна стоить любая процедура, способная различить две гипотезы с заданной надёжностью. Граница учитывает информацию от ИИ, истинную метку человека и остаточную пользу человеческого ответа после уже полученного отчёта модели.
Когда допустимые вероятности ошибок стремятся к нулю, затраты SCALE совпадают с этой границей в главном порядке. Иными словами, другая корректная адаптивная схема не сможет заметно улучшить ведущую часть стоимости в рамках той же математической модели.
В численном примере SCALE сэкономил до 36,37% относительно более дешёвого варианта с одним источником, когда менялась цена человеческой проверки. При ужесточении требований к надёжности экономия достигла 39,16%.
На краях гибрид почти исчезает. При дешёвой работе эксперта SCALE ведёт себя как проверка человеком, а при очень дорогой — как проверка только ИИ. Наибольший выигрыш возникает посередине: модель даёт полезный дешёвый сигнал, но некоторые её ответы всё ещё выгодно проверять.
Численные опыты проверяют математическую постановку с бинарной истинной меткой, конечным набором отчётов ИИ и заранее заданными затратами. Это сравнение политик в расчётной модели, а не замер на производственном сервисе или отдельном LLM-бенчмарке.
Что меняется в плане системы оценки
Работа меняет планы команд, которым нужно формально подтвердить показатель по всей совокупности объектов. Если текущая схема прогоняет каждый ответ через одну модель и принимает её вердикт за истину, средней точности оценщика недостаточно: даже редкое систематическое смещение может нарушить заданный риск ошибочного вывода.
Практическая архитектура разделяется на четыре части: модель-оценщик, источник эталонных человеческих меток, накопитель статистических свидетельств и политика эскалации. Последняя должна уметь пропустить запрос к ИИ, запросить человека сразу или проверить конкретный отчёт модели. Фиксированный процент ручной проверки не использует различия между отчётами и состоянием всей проверки.
Если поведение оценщика заранее неизвестно, SCALE можно настроить по пилотной выборке, где каждый объект проверяют и ИИ, и человек. Защитные поправки учитывают неопределённость этой настройки. При достаточно информативном пилоте процедура сохраняет тот же главный порядок затрат, что и вариант с заранее известными ошибками модели.
Область применения остаётся узкой, но понятной: скрытая метка бинарна, сравниваются две конкретные доли, модель выдаёт конечный набор отчётов, а её связь с человеческой оценкой стабильна в рамках проверки. Для ранжирования ответов, нескольких классов или меняющегося оценщика потребуется другая статистическая постановка.
Поэтому SCALE стоит учитывать не как замену экспертов, а как схему управления доказательствами и бюджетом. Она особенно полезна там, где итогом должен стать проверяемый вывод о доле корректных, безопасных или соответствующих политике объектов, а не просто средняя оценка модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



