Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Авторы SAGE предлагают заменить целостную оценку ответа через LLM-as-a-judge проверкой атомарных изменений workflow state. SAGE-Core обрабатывает критерии символическими правилами и локальными encoder-моделями, а при недостаточной уверенности воздерживается от решения. На четырёх тестовых срезах этот вариант не уступил проверенным авторами LLM judges и не использовал платные API. Работа опубликована как препринт и не проходила рецензирования, поэтому результаты остаются заявкой авторов.
Что измеряли
SAGE рассчитан на task-oriented dialogue agents, которые обслуживают формализованные процессы: бронирование, поддержку, оформление заявок. Для таких систем корректность ответа зависит не только от текста, но и от изменения внутреннего состояния.
На вход evaluator получает спецификацию workflow, историю диалога, текущие реплики пользователя и агента, а также состояние до и после хода. Спецификация включает схему слотов, обязательные поля, допустимый порядок их заполнения и условие завершения процесса. Компилятор превращает разницу между состояниями в отдельные критерии четырёх типов:
- IUV — пользователь сообщил значение, но агент не записал его в состояние;
- WNF — агент запросил поле, которое не должно быть следующим по спецификации;
- PC — агент подтвердил результат до выполнения необходимых условий;
- UV — в состоянии появилось значение, не подтверждённое историей диалога.
Критерии проходят через каскад. На первом этапе применяются детерминированные правила над схемой и state diff. На втором DeBERTa-v3-base проверяет логическое следование, а MiniLM используется для определения перефразировок. Если разница между вероятностями entailment и contradiction по модулю меньше 0,20, проверка воздерживается от ответа. Порог и минимальную уверенность извлечения 0,5 авторы настроили на отдельном наборе из 40 ходов.
Конфигурация SAGE-Core ограничивается компилятором, правилами и encoder-моделями. SAGE-LLM дополнительно передаёт оставшиеся критерии в GPT-4.1, причём модель получает не весь диалог, а один критерий и минимальный фрагмент доказательств. Итоговый ход считается ошибочным, если сработал хотя бы один критерий. Если ошибок не найдено, но остались воздержания, ход помечается как undecided; в основных результатах такие случаи засчитывались как приемлемые.
Проверка охватила четыре среза общей размерностью 1003 хода. Два среза по 250 ходов построены на MultiWOZ 2.4: смешанный набор со всеми четырьмя классами и набор с 121 ошибкой типа UV. Ещё 280 ходов взяты из Schema-Guided Dialogue, включая 37 сочетаний service и intent, а 223 хода — из ABCD, где проверялся только класс UV.
В качестве baseline авторы использовали G-Eval на GPT-4.1 с шестью вызовами на ход, одношагового GPT-4.1 judge и каскад FrugalGPT на GPT-4.1-mini и GPT-4.1. Для части вариантов judge видел только transcript, для другой части — также схему и состояния до и после хода. Авторы считали precision, recall, F1, стоимость API и медианную задержку, а доверительные интервалы получили бутстрэпом на 10 000 выборках.
Что показали
SAGE-Core вынес решение по 81–91% скомпилированных критериев без обращения к платной LLM. Остальное каскад мог оставить без решения или передать в опциональный GPT-4.1. По замерам авторов, добавление этого уровня не повысило F1 ни на одном срезе: в ablation-конфигурации без S3, то есть SAGE-Core, результат совпал с SAGE-LLM или оказался выше.
На смешанном MultiWOZ разница F1 между SAGE-Core и выбранным авторами лучшим baseline составила +0,069 при p=0,022. На ABCD-UV разница достигла +0,056 при p=0,044. На Schema-Guided Dialogue SAGE-Core получил F1 0,864, а преимущество над лучшим GPT-4.1 baseline составило +0,075 с 95-процентным интервалом от +0,015 до +0,102.
На MultiWOZ UV-rich преимущества по качеству не было: разница с transcript-only G-Eval составила −0,003, доверительный интервал — от −0,052 до +0,046, p=0,89. Авторы интерпретируют это как статистическую ничью. SAGE-Core обработал этот срез с F1 0,920, нулевыми расходами на платный API и медианной локальной задержкой 0,03 секунды. G-Eval стоил $4,70 на 1000 ходов и имел медианную задержку 12 секунд. Эти задержки измерялись в разных режимах: локальный warm in-process запуск нельзя напрямую сопоставлять с wall-clock временем API.
В остальных экспериментах GPT-4.1 G-Eval стоил $4,7–8,0 на 1000 ходов. Замена backbone на GPT-4.1-mini снизила стоимость до $0,9–1,6 при сопоставимом числе токенов. Лучший дешёвый judge достиг F1 0,901 на MultiWOZ против 0,920 у SAGE-Core и 0,859 на SGD против 0,864. Расходы SAGE-Core указаны как $0 только для платных LLM-вызовов: локальные вычисления encoder-моделей авторы в денежную стоимость не переводили.
Отдельный аудит провели два аннотатора на 200 примерах. Согласие между ними составило κ=0,94. Аудит поддержал разметку для PC и UV, но показал, что IUV не всегда воспринимается человеком как ошибка ответа: широкую человеческую значимость подтвердили только для 1 из 30 таких случаев. После исключения IUV основные сравнительные выводы работы не изменились.
Ограничения
Все ошибки в четырёх тестовых срезах были внедрены авторами, а не собраны из production-диалогов. Это создаёт риск частичной цикличности: символические проверки используют те же свойства workflow, по которым генерировались некоторые нарушения. В работе нет отдельного набора естественно возникших ошибок, независимого от предикатов первого этапа.
SAGE проверяет только четыре класса state-grounded ошибок. Работа не показывает, как система оценивает безопасность, полезность, стиль, связность или фактическую корректность за пределами workflow state. Авторы прямо ограничивают применимость формализованными процессами со спецификацией; для open-ended chat метод не предназначен.
Масштаб оценки — 1003 хода из MultiWOZ, SGD и ABCD плюс human audit на 200 примерах. В MultiWOZ неполный порядок обязательных полей привёл к 23% false positive для символического этапа. На SGD основной проблемой стало несовпадение нормализации значений: recall по IUV составил 0,44. На ABCD SAGE-Core пропустил 5 из 103 ошибок, когда бот называл значение, но post-turn state его не содержал.
Основные результаты используют заранее известные service и intent для маршрутизации workflow. Авторы проверили learned routers только на SGD, где изменение F1 было меньше 0,003. Сравнение стоимости не включает оборудование, эксплуатацию и энергопотребление локальных моделей. Набор baseline также ограничен реализациями на GPT-4.1 и GPT-4.1-mini; работа не сравнивает SAGE с другими локальными evaluator-моделями или правилами, разработанными под конкретный production workflow.
Что это значит
Для команд, которые строят dialogue agents поверх явной схемы и сохраняют корректные состояния до и после каждого хода, работа меняет план оценки. Вместо обязательного LLM-вызова на каждый ход можно сначала разложить workflow correctness на проверяемые инварианты: записано ли значение, разрешено ли следующее поле, выполнены ли условия подтверждения, подтверждается ли новое значение историей.
Практический вывод касается не выбора очередной judge-модели, а архитектуры evaluation pipeline. Детерминированные проверки стоит выполнять раньше семантических, encoder использовать для узких entailment-задач, а LLM оставлять для критериев, на которых предыдущие уровни воздержались. Такой каскад потенциально убирает линейный API-счёт за каждый оцениваемый ход и одновременно возвращает evidence trace с указанием нарушенного слота или условия.
Перестраивать вокруг SAGE весь контур контроля качества по этой работе рано. Сначала потребуется проверить подход на естественных ошибках конкретного агента, измерить качество его state tracking и посчитать полную стоимость локального inference. SAGE также не заменяет оценку текста, безопасности и общего успеха диалога. Но для CI, регрессионных тестов и мониторинга формализованных workflow работа даёт основание вынести state correctness в отдельный evaluator и не использовать holistic LLM judge как единственный источник решения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



