Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Для RAG-систем, которые дополняют ответы найденными документами, предложили выпускной гейт с явным учётом пропущенных данных и ошибок модели-оценщика. В нерецензированном препринте, где все числа получили сами авторы, команда Protom Group снизила долю выпусков версии с заложенным ухудшением до 22,2–35,1% против 29,3–41,8% у простого сравнения средних. Такой гейт не заменяет ручное решение, но показывает, когда автоматической оценке нельзя доверять.
AGO AI Quality Gate выдаёт один из четырёх результатов: выпустить версию, отправить её на ручную проверку, заблокировать или признать данные недостаточными. Сначала система выполняет воспроизводимые проверки: ищет обязательные источники, запрещённые фразы, персональные данные, ошибки формата и пустые ответы. Затем модель-оценщик проверяет связь ответа с найденными документами; повреждённый ответ оценщика не превращается автоматически в ноль или успешную проверку.
Гейт сравнивает новую версию с базовой не по одной средней оценке, а по вероятности регрессии в отдельных категориях запросов. Порог допустимого ухудшения, критичные проверки и правила эскалации хранятся в версионируемом профиле. Поэтому команда может менять риск-политику без скрытых констант в коде и воспроизвести решение по снимкам набора данных, профиля и версии системы.
Отдельная проверка показала, зачем валидировать модель-оценщика для каждого проекта. gpt-4.1-nano различала ответы, которые следуют источникам и нарушают их, с качеством 0,603 — лишь немного лучше случайного выбора, хотя всегда возвращала корректно оформленный результат. У gpt-4o показатель достиг 0,783, но заметно менялся между предметными областями. Корректный формат ответа модели ещё не означает, что её оценки годятся для выпуска.
Модель-оценщик проверяли на одинаковых выборках по 1200 примеров из 12 наборов RAGBench. Сам выпускной гейт испытывали отдельно на синтетических прогонах размером от 20 до 200 случаев с заложенным ухудшением, отсутствием изменений и улучшением. Это проверяет слой оценивания и поведение статистического правила, а не весь AGO на открытых производственных данных.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



