Журнал · Rit.work

TRACE переносит спор моделей из работы RAG в обучение

Метод учит RAG-модель отвергать ошибочный контекст, сохранять знания из параметров и не обрывать ответ после выбора источника.

Rit.work
Студия разработки
28 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

RAG-систему научили выбирать между найденным контекстом и фактами, записанными в параметрах модели. Команда Linyi University и Harbin Institute of Technology получила преимущество в 14,25 процентного пункта при противоречиях внутри контекста, хотя препринт не прошёл рецензирование и содержит замеры самих авторов. Спор нескольких моделей нужен только при подготовке данных: после обучения работает одна модель без дополнительных раундов рассуждения.

TRACE сначала получает ответ целевой модели без контекста, а затем запускает обсуждение с найденными материалами. Целевая модель предлагает варианты, более сильная модель ищет фактические ошибки и неверный выбор источника, третья выносит итог. Из обсуждения извлекают правильные и ошибочные варианты, а также случаи, когда ответ менялся с верного на неверный или обратно.

Эти записи превращают в учебные примеры. Модель поощряют за правильный ответ и штрафуют за конкретное ошибочное содержание, но не за служебные элементы разметки. Отдельная часть функции потерь усиливает последние токены правильного ответа и подавляет преждевременное завершение, чтобы модель не выдавала пустые ответы, обрезанные названия и фразы без ясной границы.

На Llama3.1–8B-Instruct при внутренне противоречивом контексте TRACE обошёл GRPO w/ RAG на 16 процентных пунктов. Отключение механизма полноты снизило средний результат точного совпадения с эталоном на 4,14 пункта — сильнее, чем удаление обсуждений или замена сильного критика моделью того же уровня.

Метод проверяли на Qwen2.5–7B-Instruct и Llama3.1–8B-Instruct с корректным, ошибочным, противоречивым, нерелевантным и частично релевантным контекстом. В тестах использовали ConFiQA, ExplainPE, HotPotQA, 2Wiki и MuSiQue, а сравнивали TRACE с обычным дообучением, GRPO w/ RAG, Knowledgeable-R1 и другими подходами. TRACE лучше всего проявил себя при явном конфликте источников; в длинных задачах с частично релевантными фрагментами результат зависел от набора данных и не всегда был лучшим.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу