Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Автоматический фактчекер научили отдельно искать свидетельства, проверять вывод и отказываться от ответа при слабой уверенности. R2VC с Llama-3.1-Nemotron-8B дал 84,71% точности на FEVER против 74,54% у той же модели без конвейера, хотя препринт не рецензирован и все числа получили сами авторы. Для продуктовой команды это меняет архитектурный выбор: качество растёт не только от замены LLM, но и от независимых модулей вокруг неё.
Сначала система ищет абзацы в английской Wikipedia двумя способами: по совпадению слов и по смысловой близости. Генератор составляет несколько вердиктов с обоснованиями и ссылками, а внешний модуль логического вывода сравнивает каждый вариант с найденными абзацами. Он поощряет подтверждение тезиса и согласованность ссылок, но штрафует противоречия и выбирает лучший вариант.
Отдельный калибратор оценивает вероятность правильного ответа по сигналам генератора и проверяющего модуля. Если уверенности недостаточно, система возвращает неопределённый вердикт вместо категоричного ответа. В разборе по частям выбор кандидата и калибровка дали основной прирост; без калибратора ошибка оценки вероятности по показателю Brier почти удвоилась.
Конвейер обучали на VitaminC и проверяли на VitaminC и FEVER с двумя моделями одного масштаба. Оба набора построены на утверждениях и свидетельствах из Wikipedia, поэтому результаты относятся прежде всего к проверке текста в фиксированном корпусе. Ручной разбор 250 ошибок показал главный предел схемы: поиск часто выбирает страницу не той сущности, после чего остальные модули могут уверенно подтвердить неверный контекст. Значит, при построении такой системы сначала стоит измерять качество поиска и разрешения неоднозначных названий, а уже затем дорабатывать формулировку ответа.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



