Журнал · Rit.work

EAVer учит проверку фактов работать с ответом целиком

EAVer группирует связанные утверждения, повторно использует найденные свидетельства и сокращает число поисковых запросов примерно на 80% без потери точности.

Rit.work
Студия разработки
22 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Проверку длинных ответов LLM научили выполнять точнее и с гораздо меньшим числом обращений к веб-поиску. В нерецензированном препринте, где все числа получили сами авторы, Kening Zheng и соавторы показали, что EAVer сократил число поисков примерно на 80% относительно самого экономного поискового аналога и при этом точнее классифицировал факты. Для команд это аргумент менять не базовую модель, а схему управления проверкой: отказаться от отдельного поиска для каждого утверждения.

Как EAVer проверяет ответ целиком

Обычная система сначала разбивает ответ на отдельные утверждения, затем ищет свидетельства для каждого из них и выносит вердикты. Если несколько утверждений относятся к одному человеку или событию, такая схема повторно открывает одни и те же страницы, а число вызовов LLM и поиска растёт вместе с длиной ответа.

EAVer превращает весь цикл в единую обучаемую последовательность действий. Модель извлекает утверждения, объединяет их по сущностям, оценивает свою уверенность и решает, какой группе нужен внешний поиск. Группу с высокой уверенностью она проверяет напрямую, а для группы с сомнительными фактами формирует общий поисковый запрос.

Результаты поиска модель сжимает в короткую записку со свидетельствами. Записка остаётся в общем контексте, поэтому следующие утверждения из той же группы могут использовать её без нового обращения к поиску. Это не отдельная база и не внешний кеш: сведения передаются внутри одной последовательности проверки.

Политику обучали на 1 447 синтетических последовательностях. Claude Opus 4.8 получал эталонные утверждения и метки, выполнял настоящий поиск и составлял полную запись действий: от группировки до итоговых вердиктов. Ученическая модель при работе эталонных меток не видит.

После основного обучения добавили этап обучения по предпочтениям. Для него брали последовательности, в которых нужное свидетельство уже найдено, но итоговый вердикт ошибочен. Поиск, группировку и записку оставляли без изменений, а исправляли только решение «поддержано» или «не поддержано». Так модель училась читать найденные сведения внимательнее, не меняя освоенную стратегию поиска.

Где сокращаются поиски и растёт точность

EAVer на базе Qwen3-8B в среднем выполнял 3,14 поиска на ответ против 15,62 у VeriFastScore, самого экономного поискового аналога. В этот расчёт входят только обращения к поисковому API: вызовы LLM внутри многоступенчатых систем не учитывались. Поэтому результат показывает экономию на поиске, но не полную стоимость выполнения.

Точность оценивали через макро-F1 — показатель, который поровну учитывает качество распознавания поддержанных и неподдержанных утверждений. На VeriFastScore EAVer обошёл лучший поисковый аналог на 2,88 пункта, а на FaStFact-Bench — на 4,73 пункта. Второй набор не использовался для обучения и проверяет перенос метода на данные другого происхождения.

Разбор компонентов подтверждает, что результат даёт не только дополнительное обучение. Без группировки модель строила более длинные последовательности и чаще искала. Без записок она повторно находила одни и те же ссылки, а без проверки уверенности отправляла в поиск утверждения, с которыми могла справиться самостоятельно.

Когда командам стоит менять схему проверки

Работа касается систем, которые проверяют длинные ответы с несколькими связанными фактами: исследовательских помощников, генераторов отчётов и контуров контроля контента. Если продукт отвечает короткой фразой или проверяет одно утверждение за запрос, повторное использование свидетельств даст меньше пользы.

Метод проверяли на VeriFastScore и FaStFact-Bench с моделями семейств Qwen и Llama разных размеров. Задача в обоих случаях бинарная: система должна решить, поддержано утверждение или нет. Это уже содержательная проверка переноса между моделями и наборами данных, но не замер задержки и полной стоимости производственного сервиса.

Менять базовую модель ради такого подхода не требуется: обучение улучшало результаты у всех испытанных вариантов. Практический первый шаг — сгруппировать утверждения по сущностям и событиям, дать группе общий бюджет поиска и хранить краткую выжимку свидетельств в контексте проверки.

Обучаемая политика нужна не каждой системе. Группировку, порог уверенности и повторное использование сведений можно сначала проверить в существующей схеме управления. Если поисковые запросы действительно повторяются, работа EAVer показывает следующий шаг: обучать модель принимать решения по всему ответу, а не настраивать независимый конвейер для каждого факта.

Источники

Иллюстрация: рисунок из статьи «EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy», Kening Zheng, Aoying Zheng, Zhigang Chang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу