Журнал · Rit.work

Проверка SQL-запросов меняет обещанный системой риск

Оценка риска text-to-SQL зависит от базы, на которой проверяют запросы, а показатели уверенности завышаются при оценке на собственных метках.

Rit.work
Студия разработки
23 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Сертификат риска для text-to-SQL может обещать одну частоту ошибок, а фактически пропускать другую: результат задаёт способ проверки SQL-запросов. В препринте команды Army Medical University, который не прошёл рецензирование и содержит замеры самих авторов, при целевом риске 10% эксперты оценили фактический риск двух моделей в 20,0% и 17,2%. Значит, порог отказа нельзя настраивать и проверять по одним и тем же меткам.

Система генерировала несколько запросов для каждого вопроса и объединяла их по совпадающим результатам выполнения. Доля крупнейшей группы служила показателем уверенности, а конформный сертификат выбирал порог, ниже которого система отказывалась отвечать. Исследователи по отдельности меняли механизм группировки и проверку правильности: использовали либо одну базу из Spider-Realistic, либо набор баз с разными данными.

При переходе от одной базы к набору баз риск оказался на 2,73–10,23 процентного пункта выше, чем сообщал сертификат на собственных метках. Однако строгая проверка тоже не стала заменой экспертной оценки: семантическая ошибка нашлась лишь в четверти или трети отклонённых ответов. Остальные расхождения связаны с неоднозначными вопросами, искусственными данными и предполагаемыми дефектами эталонных запросов.

Способ проверки влиял и на оценку уверенности. Во всех 16 сочетаниях модели и показателя согласованность выполнения выглядела лучше по меткам той проверки, которая сформировала группы запросов. При независимой экспертной разметке переход к группировке по набору баз улучшил площадь под ROC-кривой на 6,96 пункта для одной модели, но для второй статистически надёжного роста не получили. Поэтому такой показатель следует тестировать на метках, которые не участвовали в его построении.

Основной эксперимент охватил четыре специализированные модели из двух семейств Qwen и все 508 вопросов Spider-Realistic. Экспертная проверка была уже: она покрыла две модели при одном запуске. Работа показывает риск конкретной схемы оценки, а не качество всех систем text-to-SQL.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу