Журнал · Rit.work

KC-Bench разделяет три типа конфликтов знаний у LLM-агентов

KC-Bench проверяет, замечают ли LLM-агенты противоречия между запросом пользователя, внутренними знаниями и данными инструментов до выполнения действий.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Yaxing Lyu, Shengjie Zhou, Binbin Toh, Pengyu Zhu и Lijun Li представили KC-Bench для проверки LLM-агентов в ситуациях с противоречивыми сведениями — работа опубликована как не прошедший рецензирование препринт. По замерам авторов, MiniMax-M3 успешно прошла 67,6% заданий на фактические противоречия, но только 38% заданий с несовпадающими данными пользователя и базы. Результаты важны для команд, которые дают модели доступ к учётным записям, сообщениям и другим инструментам с последствиями для состояния системы.

Что сделали

KC-Bench содержит 238 многошаговых заданий в трёх средах: справочник регионов, розничное обслуживание и личный помощник. Авторы разделили конфликты по источнику противоречия.

  • Конфликт с мировыми знаниями. Пользователь задаёт ложную предпосылку, которая расходится со знаниями, усвоенными моделью при обучении. Агент должен исправить факт до вызова инструмента.
  • Несогласованность ввода. Часть реквизитов пользователя совпадает с записью в базе, а другая часть — например, имя — нет. До чтения защищённых полей или изменения состояния требуется уточнение.
  • Конфликт нескольких источников. Инструменты возвращают актуальные и устаревшие записи. Агент должен сопоставить время и состояние данных, а не выполнить просьбу по старому идентификатору.

Задания выполнялись с симулятором пользователя и инструментами, сохраняющими состояние. Успех засчитывался, только если модель явно обнаруживала конфликт и не раскрывала защищённые данные либо не меняла состояние до проверки. Автоматические решения модели-оценщика авторы дополнительно сверяли вручную по полной последовательности действий.

Что это значит

Разброс между средами показывает, что общий навык работы с инструментами не гарантирует единого механизма проверки сведений. По наблюдениям авторов, в первом классе модели принимали ложную предпосылку пользователя, во втором не сопоставляли поля одной личности, а в третьем могли отказаться от верного вывода после повторного давления пользователя. Поэтому проверку личности, прав доступа и актуальности записи нельзя оставлять только рассуждению LLM: её следует закреплять в правилах API и инструментов.

Ограничения. KC-Bench проверяет девять моделей на синтетических данных и по одному прогону каждого задания. Работа измеряет поведение самой модели в стандартизированной среде, а не надёжность готовых агентных систем или частоту подобных ошибок в эксплуатации. В сравнение авторов не вошли полные агентные фреймворки и варианты с детерминированными проверками конфликтов, поэтому бенчмарк не показывает, насколько такие механизмы сокращают число ошибок.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу