Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Yaxing Lyu, Shengjie Zhou, Binbin Toh, Pengyu Zhu и Lijun Li представили KC-Bench для проверки LLM-агентов в ситуациях с противоречивыми сведениями — работа опубликована как не прошедший рецензирование препринт. По замерам авторов, MiniMax-M3 успешно прошла 67,6% заданий на фактические противоречия, но только 38% заданий с несовпадающими данными пользователя и базы. Результаты важны для команд, которые дают модели доступ к учётным записям, сообщениям и другим инструментам с последствиями для состояния системы.
Что сделали
KC-Bench содержит 238 многошаговых заданий в трёх средах: справочник регионов, розничное обслуживание и личный помощник. Авторы разделили конфликты по источнику противоречия.
- Конфликт с мировыми знаниями. Пользователь задаёт ложную предпосылку, которая расходится со знаниями, усвоенными моделью при обучении. Агент должен исправить факт до вызова инструмента.
- Несогласованность ввода. Часть реквизитов пользователя совпадает с записью в базе, а другая часть — например, имя — нет. До чтения защищённых полей или изменения состояния требуется уточнение.
- Конфликт нескольких источников. Инструменты возвращают актуальные и устаревшие записи. Агент должен сопоставить время и состояние данных, а не выполнить просьбу по старому идентификатору.
Задания выполнялись с симулятором пользователя и инструментами, сохраняющими состояние. Успех засчитывался, только если модель явно обнаруживала конфликт и не раскрывала защищённые данные либо не меняла состояние до проверки. Автоматические решения модели-оценщика авторы дополнительно сверяли вручную по полной последовательности действий.
Что это значит
Разброс между средами показывает, что общий навык работы с инструментами не гарантирует единого механизма проверки сведений. По наблюдениям авторов, в первом классе модели принимали ложную предпосылку пользователя, во втором не сопоставляли поля одной личности, а в третьем могли отказаться от верного вывода после повторного давления пользователя. Поэтому проверку личности, прав доступа и актуальности записи нельзя оставлять только рассуждению LLM: её следует закреплять в правилах API и инструментов.
Ограничения. KC-Bench проверяет девять моделей на синтетических данных и по одному прогону каждого задания. Работа измеряет поведение самой модели в стандартизированной среде, а не надёжность готовых агентных систем или частоту подобных ошибок в эксплуатации. В сравнение авторов не вошли полные агентные фреймворки и варианты с детерминированными проверками конфликтов, поэтому бенчмарк не показывает, насколько такие механизмы сокращают число ошибок.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



