Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LatWeave делает ответы на многошаговые вопросы воспроизводимыми: после подготовки знаний и разбора вопроса итог вычисляет обычный программный модуль, а не генеративная модель. В препринте, который не прошёл рецензирование и в котором все числа получили сами авторы, система дала 86,5% точных ответов на 2WikiMultihopQA. Такой подход позволяет отделить вероятностное понимание текста от проверяемого исполнения запроса.
Как вопрос превращается в операции над знаниями
Многошаговый вопрос требует последовательно связать несколько фактов. Например, сначала найти произведение режиссёра, затем определить исполнителя роли и проверить место его рождения. В RAG-системе документы обычно извлекает поисковый модуль, а окончательный вывод формулирует LLM, поэтому ссылка на источник ещё не доказывает правильность перехода между фактами.
LatWeave заранее преобразует документы в решётку знаний. LLM извлекает из текста типизированные признаки: сущность, отношение, значение и фрагмент-источник. Значения объединяются в измерения и иерархии, поэтому система знает, например, что конкретный вид относится к более общей категории.
При получении вопроса другая LLM составляет типизированный план. После этого модель больше не участвует: программное ядро выполняет три операции.
- Пересечение объединяет ограничения по измерениям и возвращает все подходящие точки решётки.
- Сравнение проверяет порядок значений, выбирает крайнее значение или сопоставляет два объекта.
- Отказ срабатывает, если ограничения противоречат друг другу или подходящей точки в решётке нет.
Каждая найденная точка хранит исходный фрагмент текста. Проверяющий может повторить пересечения, пройти цепочку и сопоставить каждый факт с источником. При одинаковых решётке и плане результат не меняется.
Эта оговорка существенна: вся система не становится детерминированной. LLM по-прежнему извлекает знания и разбирает вопрос, поэтому может пропустить отношение или построить неверный план. Детерминирован только путь от готового плана и решётки до ответа.
Полные знания дают высокий результат, открытый текст ломает цепочки
Метод проверяли на MetaQA, 2WikiMultihopQA, HotpotQA, MuSiQue, FRAMES и IIRC. Наборы охватывают готовую базу фактов, шаблонные вопросы по тексту, длинные цепочки из открытых документов и вопросы, для которых нужной информации может не быть.
На MetaQA, где факты уже заданы в виде структурированных троек, хотя бы один правильный ответ найден в 99,75% случаев. Результат оказался на уровне систем, которые обучались специально для ответов по базам знаний. На 2WikiMultihopQA точное совпадение с эталоном составило 86,5% и превысило приведённые в работе результаты воспроизведённых вариантов RAG со структурой.
На менее регулярных данных картина меняется. Точное совпадение составило 16,87% на HotpotQA и 2,48% на MuSiQue. Основная проблема возникала до выполнения операций: извлечение не переносило нужный факт в решётку, цепочка попадала не на ту сущность или план запрашивал отношение, которого у промежуточной сущности не было.
На IIRC система правильно отказалась отвечать в 97,1% вопросов без достаточной информации. Такой отказ не означает, что факта не существует: он показывает, что в текущей решётке нет точки, которая удовлетворяет запросу. Это полезное, но более узкое обещание, чем проверка истинности ответа о внешнем мире.
Границы эксперимента проходят по форме данных и типу операций. Лучше всего LatWeave работает с полными либо шаблонно устроенными знаниями. Глубокие цепочки по свободному тексту заметно ухудшают результат, а вычисление производных значений, включая арифметику и подсчёты, авторы оставили внешним модулям.
Когда LatWeave меняет архитектурный план
Работа предлагает не замену RAG для любых вопросов, а отдельную архитектуру для продуктов с ограниченным корпусом и проверяемыми правилами. Если ответ должен собираться из известных сущностей, фильтров и сравнений, генерацию в конце цепочки можно заменить исполнителем с фиксированной семантикой.
Цена такого решения переносится на подготовку знаний. Команде потребуются стабильные измерения, нормализация синонимов, удаление дублей и тесты полноты извлечения. Ошибка на этом этапе не породит выдуманный текст, но приведёт к отказу или пропущенному ответу.
Особенно уместна схема там, где недостаточно показать документы, использованные LLM. LatWeave позволяет проверить сам переход от условий вопроса к результату: какие ограничения применили, какие множества пересекли и какой фрагмент подтверждает найденную сущность.
Для открытого поиска по разнородным документам менять действующую RAG-архитектуру по этой работе рано. Замеры на HotpotQA и MuSiQue показывают, что детерминированное ядро не исправляет неполную индексацию и ошибки планирования. Практический кандидат на внедрение — узкий контур с управляемой схемой, где отказ предпочтительнее правдоподобного ответа, а каждую цепочку нужно воспроизвести при проверке.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



