Журнал · Rit.work

LLM отдают приоритет ранним источникам при конфликте данных

Авторы ContextConflict проверили, как LLM объединяют противоречивые источники, и предложили корректировать смещение к ранним фрагментам через изменение внутренних активаций.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из Northwestern University, New York University и University of Florida собрали ContextConflict для проверки LLM на противоречиях внутри переданного контекста и предложили способ корректировать ответы без обучения и разметки; работа опубликована как препринт, не проходивший рецензирования. Наибольший измеренный прирост точности составил 19,2 процентного пункта на задаче временного рассуждения. Результат важен командам, которые строят поиск с генерацией ответа, анализ нескольких документов и другие системы, где модель должна согласовывать сведения из разных источников.

Что сделали

Обычно конфликт знаний проверяют между тем, что LLM запомнила при обучении, и информацией из запроса. Авторы исследовали другой случай: модель получает несколько документов, которые противоречат друг другу, различаются по времени или описывают предмет с несовместимых позиций.

Для этого они определили шесть типов конфликтов. Дезинформация, ошибки в цепочке вывода и временные расхождения оформлены как задачи с проверяемым правильным ответом. Различия в детализации, несовпадающие перспективы и неоднозначные имена требуют сводки, которая учитывает все релевантные фрагменты, а не выбирает один из них.

Конфликты разделены на явные и неявные. Первые обнаруживаются прямым сопоставлением утверждений. Вторые требуют связать несколько фрагментов и выполнить многошаговое рассуждение. Авторы оценили семь закрытых и открытых моделей, включая GPT-5, Claude-4.5-Sonnet, Gemini-2.5-Pro, GPT-OSS и Llama.

Для задач рассуждения использовали точность — долю ответов, совпавших с эталоном. Для сводок ввели показатель баланса на основе вкладов Шепли: он оценивает, насколько равномерно источники повлияли на сформированный текст. Чем показатель ниже, тем меньше ответ зависит от одного фрагмента. Отдельная метрика проверяла обоснованность — долю утверждений ответа, подтверждённых переданным контекстом.

После анализа внутренних представлений авторы предложили направленное изменение активаций. Каждый фрагмент сначала обрабатывается отдельно, затем по полученным внутренним состояниям вычисляется направление, вдоль которого корректируются активации при совместной обработке документов. Метод не требует обновлять веса модели или размечать правильные ответы, но требует доступа к её внутренним слоям.

Что показали

Сложнее всего моделям дались конфликты в цепочках вывода: лучший результат составил 44,3% точных ответов. Авторы интерпретируют это как признак того, что увеличение размера и общей способности модели само по себе не устраняет ошибки при объединении несовместимых предпосылок.

Анализ сводок выявил устойчивое смещение к фрагментам, расположенным раньше в контексте. В задаче с неоднозначными именами первый фрагмент обеспечивал 69% измеренного вклада в ответ Llama-3.1-8B-Instruct. Перемешивание порядка свидетельств меняло их влияние, поэтому авторы связывают эффект именно с позицией, а не только с содержанием источника.

При вмешательстве во внутренние активации точность рассуждений и баланс сводок в основном улучшались. Наиболее результативным оказался режим, в котором коррекция применялась при генерации каждого токена. Предложенное направление также чаще превосходило Context-Aware Steering — альтернативу, которая усиливает общую зависимость модели от контекста, но не нацелена специально на выравнивание вкладов источников.

Улучшение баланса не означает автоматического роста качества по всем критериям. В отдельных задачах обоснованность рассуждений немного снижалась: модель активнее соединяла несколько свидетельств, но формулировала выводы, которые сложнее непосредственно сопоставить с исходными фрагментами.

Ограничения

ContextConflict содержит 5 781 пример, собранный из десяти исходных наборов данных. Около 30% примеров созданы с синтетическими дополнениями, включая сгенерированные конфликтующие свидетельства и временные отметки. Авторы проверяли качество разметки с разной полнотой в зависимости от риска ошибки, однако работа не показывает поведение метода на шумной выдаче реального поиска, где документы различаются по достоверности, полноте и происхождению.

Направленное изменение активаций испытали только на двух открытых моделях масштаба 8B и 20B параметров. Для него нужен доступ к остаточному потоку активаций, поэтому метод нельзя напрямую перенести на модели, доступные исключительно через API. Дополнительные проходы по отдельным свидетельствам также создают вычислительные расходы во время ответа, но работа не даёт производственного сравнения задержки и стоимости.

Собственный эксперимент авторов сопоставляет метод с Context-Aware Steering, но не с фильтрацией конфликтующих документов, изменением порядка выдачи или дополнительным обучением. Показатель баланса предполагает, что источники в среднем заслуживают равного внимания. В прикладной системе это условие часто не выполняется: официальный документ и случайная веб-страница не должны автоматически получать одинаковый вес.

Что это значит

Работа не требует менять выбранную архитектуру продукта, но меняет требования к её проверке. Обычных тестов на поиск правильного фрагмента недостаточно: набор приёмочных сценариев должен включать противоречащие документы, перестановку их порядка, устаревшие сведения и позиции, которые нельзя свести к одному «правильному» утверждению.

Командам с открытыми моделями предложенный способ даёт направление для эксперимента без переобучения. Его следует рассматривать как внутреннюю оптимизацию вывода, а не готовую замену ранжированию и оценке надёжности источников. Перед внедрением потребуется отдельно измерить задержку, стоимость дополнительных проходов и влияние на обоснованность ответов в данных конкретного продукта.

Для систем на закрытых API практический вывод относится прежде всего к проектированию контура: порядок документов способен влиять на итог сильнее, чем предполагает интерфейс модели. Поэтому перестановка источников и проверка устойчивости ответа должны стать частью оценки модели, даже если доступ к её активациям отсутствует.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу