Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Сертификат риска для text-to-SQL может обещать одну частоту ошибок, а фактически пропускать другую: результат задаёт способ проверки SQL-запросов. В препринте команды Army Medical University, который не прошёл рецензирование и содержит замеры самих авторов, при целевом риске 10% эксперты оценили фактический риск двух моделей в 20,0% и 17,2%. Значит, порог отказа нельзя настраивать и проверять по одним и тем же меткам.
Система генерировала несколько запросов для каждого вопроса и объединяла их по совпадающим результатам выполнения. Доля крупнейшей группы служила показателем уверенности, а конформный сертификат выбирал порог, ниже которого система отказывалась отвечать. Исследователи по отдельности меняли механизм группировки и проверку правильности: использовали либо одну базу из Spider-Realistic, либо набор баз с разными данными.
При переходе от одной базы к набору баз риск оказался на 2,73–10,23 процентного пункта выше, чем сообщал сертификат на собственных метках. Однако строгая проверка тоже не стала заменой экспертной оценки: семантическая ошибка нашлась лишь в четверти или трети отклонённых ответов. Остальные расхождения связаны с неоднозначными вопросами, искусственными данными и предполагаемыми дефектами эталонных запросов.
Способ проверки влиял и на оценку уверенности. Во всех 16 сочетаниях модели и показателя согласованность выполнения выглядела лучше по меткам той проверки, которая сформировала группы запросов. При независимой экспертной разметке переход к группировке по набору баз улучшил площадь под ROC-кривой на 6,96 пункта для одной модели, но для второй статистически надёжного роста не получили. Поэтому такой показатель следует тестировать на метках, которые не участвовали в его построении.
Основной эксперимент охватил четыре специализированные модели из двух семейств Qwen и все 508 вопросов Spider-Realistic. Экспертная проверка была уже: она покрыла две модели при одном запуске. Работа показывает риск конкретной схемы оценки, а не качество всех систем text-to-SQL.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



