Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Проверку длинных ответов LLM научили выполнять точнее и с гораздо меньшим числом обращений к веб-поиску. В нерецензированном препринте, где все числа получили сами авторы, Kening Zheng и соавторы показали, что EAVer сократил число поисков примерно на 80% относительно самого экономного поискового аналога и при этом точнее классифицировал факты. Для команд это аргумент менять не базовую модель, а схему управления проверкой: отказаться от отдельного поиска для каждого утверждения.
Как EAVer проверяет ответ целиком
Обычная система сначала разбивает ответ на отдельные утверждения, затем ищет свидетельства для каждого из них и выносит вердикты. Если несколько утверждений относятся к одному человеку или событию, такая схема повторно открывает одни и те же страницы, а число вызовов LLM и поиска растёт вместе с длиной ответа.
EAVer превращает весь цикл в единую обучаемую последовательность действий. Модель извлекает утверждения, объединяет их по сущностям, оценивает свою уверенность и решает, какой группе нужен внешний поиск. Группу с высокой уверенностью она проверяет напрямую, а для группы с сомнительными фактами формирует общий поисковый запрос.
Результаты поиска модель сжимает в короткую записку со свидетельствами. Записка остаётся в общем контексте, поэтому следующие утверждения из той же группы могут использовать её без нового обращения к поиску. Это не отдельная база и не внешний кеш: сведения передаются внутри одной последовательности проверки.
Политику обучали на 1 447 синтетических последовательностях. Claude Opus 4.8 получал эталонные утверждения и метки, выполнял настоящий поиск и составлял полную запись действий: от группировки до итоговых вердиктов. Ученическая модель при работе эталонных меток не видит.
После основного обучения добавили этап обучения по предпочтениям. Для него брали последовательности, в которых нужное свидетельство уже найдено, но итоговый вердикт ошибочен. Поиск, группировку и записку оставляли без изменений, а исправляли только решение «поддержано» или «не поддержано». Так модель училась читать найденные сведения внимательнее, не меняя освоенную стратегию поиска.
Где сокращаются поиски и растёт точность
EAVer на базе Qwen3-8B в среднем выполнял 3,14 поиска на ответ против 15,62 у VeriFastScore, самого экономного поискового аналога. В этот расчёт входят только обращения к поисковому API: вызовы LLM внутри многоступенчатых систем не учитывались. Поэтому результат показывает экономию на поиске, но не полную стоимость выполнения.
Точность оценивали через макро-F1 — показатель, который поровну учитывает качество распознавания поддержанных и неподдержанных утверждений. На VeriFastScore EAVer обошёл лучший поисковый аналог на 2,88 пункта, а на FaStFact-Bench — на 4,73 пункта. Второй набор не использовался для обучения и проверяет перенос метода на данные другого происхождения.
Разбор компонентов подтверждает, что результат даёт не только дополнительное обучение. Без группировки модель строила более длинные последовательности и чаще искала. Без записок она повторно находила одни и те же ссылки, а без проверки уверенности отправляла в поиск утверждения, с которыми могла справиться самостоятельно.
Когда командам стоит менять схему проверки
Работа касается систем, которые проверяют длинные ответы с несколькими связанными фактами: исследовательских помощников, генераторов отчётов и контуров контроля контента. Если продукт отвечает короткой фразой или проверяет одно утверждение за запрос, повторное использование свидетельств даст меньше пользы.
Метод проверяли на VeriFastScore и FaStFact-Bench с моделями семейств Qwen и Llama разных размеров. Задача в обоих случаях бинарная: система должна решить, поддержано утверждение или нет. Это уже содержательная проверка переноса между моделями и наборами данных, но не замер задержки и полной стоимости производственного сервиса.
Менять базовую модель ради такого подхода не требуется: обучение улучшало результаты у всех испытанных вариантов. Практический первый шаг — сгруппировать утверждения по сущностям и событиям, дать группе общий бюджет поиска и хранить краткую выжимку свидетельств в контексте проверки.
Обучаемая политика нужна не каждой системе. Группировку, порог уверенности и повторное использование сведений можно сначала проверить в существующей схеме управления. Если поисковые запросы действительно повторяются, работа EAVer показывает следующий шаг: обучать модель принимать решения по всему ответу, а не настраивать независимый конвейер для каждого факта.
Источники
Иллюстрация: рисунок из статьи «EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy», Kening Zheng, Aoying Zheng, Zhigang Chang и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



