Журнал · Rit.work

GRACE проверяет утверждения LLM по графу доверенных знаний

GRACE разбирает ответы LLM на отдельные утверждения, сверяет их с доверенными материалами и направляет экспертам только важные спорные случаи.

Rit.work
Студия разработки
7 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

GRACE отделяет в ответах LLM подтверждённые факты от опровергнутых и спорных утверждений, а спорное отдаёт эксперту только тогда, когда проверка оправдывает затраты. В препринте John Seon Keun Yi, Joshua R. Minot и Dokyun Lee, который не проходил рецензирование и приводит числа из замеров самих авторов, финальный набор проверенных утверждений дал 49,1% точности в ответах на вопросы против 33,6% при передаче модели полного текста. Для систем с дорогой ошибкой это предлагает дополнительный слой над поиском по документам, а не очередную замену базовой модели.

Как ответ превращается в карту проверяемых утверждений

Обычная генерация с дополнением из поиска (RAG) находит близкие по смыслу фрагменты и передаёт их модели. Она помогает модели увидеть нужный документ, но сама по себе не показывает, какое утверждение поддерживает каждый фрагмент, где источники согласны и где ответ противоречит правилам или регламенту.

GRACE сначала разбивает ответы модели и доверенные материалы на короткие самостоятельные утверждения. Доверенными материалами могут служить проверенные документы, инструкции, нормативы и записи, которые уже подтвердил эксперт.

Затем система строит двудольный граф: с одной стороны находятся ответы и источники, с другой — извлечённые утверждения. Связи получают разный вес. Прямая опора на доверенный источник весит больше, чем повторение одной и той же мысли в нескольких ответах модели, а противоречие источнику ослабляет позицию утверждения.

Это различие закрывает слабое место проверок через согласованность LLM. Если модель несколько раз уверенно повторит одну ошибку, внутреннее голосование сочтёт её надёжной. В GRACE повторяемость не заменяет связь с внешним источником.

По положению в графе утверждение получает один из трёх статусов: подтверждённое, опровергнутое или пограничное. Последняя группа включает новые, спорные и пока слабо связанные со знаниями сведения. Такая разметка не просто фильтрует ответ, а оставляет проверяемый след: можно увидеть само утверждение, его источники и причину присвоенного статуса.

Пограничные утверждения ранжирует показатель окупаемости внимания (Return on Attention). Приоритет растёт, если проверка одного узла поможет разрешить связанный кластер или расширит знания в новой области. Эксперт получает утверждение, только когда его важность с учётом неопределённости превышает стоимость проверки.

Подтверждённый экспертом факт становится новой опорой графа. Отклонённый сохраняется как известная ошибка. После пересчёта связей система может автоматически разрешить другие спорные утверждения, поэтому база знаний растёт вместе с проверками, а не остаётся статичным индексом документов.

Граф помог на научных статьях и длинных текстах

Поиск проверяли на QASPER с вопросами по научным статьям и QuALITY с вопросами по длинным текстам. Ответы строили GPT-4o-mini и LLaMA 3.1 8B, а GRACE сравнивали со стандартным RAG, GraphRAG, частичным контекстом и передачей документа целиком.

На QASPER GRACE показал точность 28,1% против 19,8% у стандартного RAG и почти сравнялся с полным контекстом. GraphRAG на части условий давал сопоставимый или лучший результат, поэтому работа не доказывает общее превосходство GRACE над любым графовым поиском. Её сильная сторона — связь найденного контекста со статусом каждого утверждения и более осторожный отказ от ответа.

В эксперименте с расширением знаний доля действительно верных фактов среди помеченных как подтверждённые достигла 97,6%. Точность ответов росла после каждого раунда, когда проверенные пограничные утверждения добавляли к доверенным знаниям. Компактный набор фактов оказался полезнее полного текста, где нужные сведения смешивались с посторонними разделами.

При увеличении числа утверждений в базе в пятьдесят раз точность снизилась менее чем на 6 процентных пунктов и после первого падения стабилизировалась. Это проверка на десятках длинных документов, а не на корпоративном архиве с меняющимися версиями, правами доступа и противоречивыми владельцами данных.

Сравнение с людьми охватило один раунд на небольшой части QASPER. Люди и модель-оценщик одинаково повлияли на итоговую точность, но модель чаще отказывалась принять решение и оставляла больше утверждений на границе. Такой результат показывает роль эксперта, но пока не оценивает длительную эксплуатацию контура.

Архитектурный план меняется, выбор модели — не обязательно

GRACE имеет смысл рассматривать там, где уже есть доверенный корпус и можно назвать владельца проверки: в комплаенсе, страховании, технической поддержке по регламентам и внутренних экспертных системах. Для обычного поиска по справке дополнительный граф может стоить дороже, чем редкая ошибка.

Первый практический вывод — не заменять RAG целиком. Поиск по смысловой близости остаётся частью GRACE, но к нему добавляются извлечение утверждений, проверка их связи с источниками, статусы и очередь для эксперта. Прототип стоит сравнивать с текущим контуром по точности подтверждённых ответов, доле отказов и времени специалиста на одну проверку.

Главная цена подхода возникает до ответа пользователю. Построение графа требует разбить документы на утверждения и проверить множество пар «источник — утверждение» с помощью LLM. Авторы называют этот этап основной вычислительной затратой и предлагают заранее отбрасывать очевидно несвязанные пары, но готовой оценки стоимости для промышленного корпуса работа не даёт.

Второй риск лежит в самих доверенных материалах. GRACE назначает им одинаковый вес, хотя рабочие инструкции устаревают, нормативы получают новые редакции, а экспертные заключения могут расходиться. До внедрения команде придётся определить версии источников, порядок их приоритета и правила отзыва уже подтверждённых фактов.

Работа меняет план систем с высокой ценой ошибки: проверку стоит проектировать как отдельный контур со своим бюджетом и состоянием знаний, а не прятать в системной подсказке модели. Но результаты пока поддерживают узкий пилот на стабильном наборе документов, а не перенос всей базы знаний на GRACE.

Источники

Иллюстрация: рисунок из статьи «GRACE: Graph-Grounded Reflective Agent Copilot Engine for Expert-in-the-Loop Knowledge Expansion», John Seon Keun Yi, Joshua R. Minot, Dokyun Lee, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу