Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Метка доверия к источнику может изменить вердикт фактчекера, даже если текст доказательств остался прежним. В препринте University of Connecticut и University of California, Santa Cruz, который не проходил рецензирование и приводит замеры самих авторов, обычное обучение с подкреплением усилило ошибку у большей Qwen3, а предложенное исправление сработало только у меньшей. Для продуктовой команды это повод тестировать вердикт, уверенность и запрос дополнительного поиска по отдельности.
Как отделили полезную реакцию на доверие от подмены вердикта
Авторы задали системе простой контракт. Содержание доказательств определяет, подтверждено ли утверждение, а надёжность источника влияет на уверенность модели и решение запросить дополнительные материалы.
TrustSwap проверяет этот контракт заменой меток HIGH и LOW. Текст доказательств, домен источника и само утверждение остаются неизменными, поэтому разницу в ответах вызывает только метка.
Тест рассматривает три канала отдельно. Первый — вердикт SUPPORTS, REFUTES или NEI, то есть подтверждение, опровержение или отказ вынести решение. Второй — заявленная уверенность. Третий — флаг, который показывает, нужен ли дополнительный поиск.
Такое разделение важно для архитектуры продукта. Снижение уверенности после замены HIGH на LOW считается ожидаемой реакцией. Запрос новых доказательств тоже полезен. Но переход от SUPPORTS к REFUTES при неизменном тексте означает, что модель использует служебную метку как короткий путь к ответу.
Проверка охватила AVeriTeC, CONFACT и SciFact, модели Qwen3 двух размеров и Veri-R1, а также нейтральную подсказку и подсказку с явно сформулированным контрактом. Модель выдавала флаг поиска, но новый поиск не запускался. Обучающие эксперименты использовали короткую LoRA-настройку GRPO — алгоритма обучения с подкреплением, который сравнивает несколько ответов модели внутри одной группы; поэтому результат описывает этот режим, а не произвольный фактчекинговый конвейер.
Метка доверия проникла именно в вердикт
Уверенность и запрос поиска менялись в ожидаемую сторону в 49 из 50 сравнений. Значит, модели понимали назначение меток: при снижении доверия они становились осторожнее и чаще просили дополнительные сведения.
Вердикт оказался менее устойчивым. У Qwen3 одна замена меток меняла 4–23% уверенных ответов, а у Veri-R1 диапазон достигал 16–50%. Чаще модель переходила к NEI, но встречались и прямые замены SUPPORTS на REFUTES или обратно.
Явная инструкция в подсказке не решила проблему. Она побуждала модель чаще отказываться от ответа при слабых источниках, но не отделяла оценку содержания от реакции на метаданные.
GRPO мог усилить короткий путь, хотя награда вообще не учитывала доверие к источнику. У большей Qwen3 частота смены вердикта выросла с 10,5% до 15,0%, тогда как точность изменилась менее чем на 2 процентных пункта. Обычная метрика качества почти скрыла ухудшение поведения.
Что менять в плане разработки
Предложенная аугментация TSA добавляет к каждому обучающему примеру копию с переставленными метками доверия. Обе версии получают один эталонный вердикт, но образуют отдельные группы GRPO. Награда продолжает учить модель отвечать по доказательствам и не запрещает снижать уверенность или просить новый поиск.
На Qwen3-4B TSA уменьшила частоту смены вердикта на 7–35% в большинстве проверенных настроек и сохранила точность. Эффект перенёсся на незнакомое преобразование, при котором метки полностью удаляли. Основной выигрыш пришёл от более стабильного решения между содержательным ответом и NEI; прямые развороты между подтверждением и опровержением метод не исправил.
Дополнительная награда за одинаковый вердикт сильнее подгоняла модель под перестановку, которую она видела при обучении, но хуже переносилась на другие изменения меток. Практический выбор из работы — простая TSA без отдельной награды за согласованность. Цена такого подхода — удвоенный объём генераций для примеров, к которым добавляют переставленную копию.
На Qwen3-8B улучшение осталось в пределах погрешности. Эксперименты обучали модель на 311 утверждениях в течение 25 шагов, причём в обучающем наборе метка LOW была связана с классом REFUTES. Поэтому TSA подходит как проверяемая защита для небольшого контролируемого обучения, но не как готовая гарантия для более крупной модели.
В план оценки стоит добавить пары с одинаковыми доказательствами и разными метками, а затем отдельно считать смены вердикта, уверенности и решения искать дальше. Если система передаёт NEI человеку, главным риском остаются развороты SUPPORTS и REFUTES. Если вердикт публикуется автоматически, к ошибкам относятся и отказы, вызванные одной служебной меткой.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



