Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
RAG-система может проверять найденную память до того, как она попадёт в контекст языковой модели. В препринте Yiming Zhang и соавторов контроллер MDL снизил долю галлюцинаций более чем вдвое; препринт не рецензирован, а все числа получили сами авторы. Для продуктовой архитектуры это означает, что поиск и использование памяти стоит разделять на два независимых этапа.
Три сигнала решают, можно ли использовать память
При генерации с дополнением из поиска (RAG) система обычно находит близкие фрагменты и сразу добавляет их в контекст. Высокая близость ещё не означает, что запись верна: устаревшая документация или распространённое заблуждение могут точно совпадать с запросом.
MDL ставят между поиском и генерацией. Он получает запрос и найденные записи, после чего вычисляет три сигнала:
- Релевантность — насколько запрос похож на самый близкий фрагмент памяти.
- Надёжность — насколько найденные записи согласуются друг с другом. Её снижает простой лексический детектор отрицаний, противоположных ответов и антонимов.
- Риск задачи — насколько опасна ошибка в этой категории запроса. Для медицины, права и финансов контроллер должен охотнее отказываться от ответа.
Сигналы кодируются в векторы и проецируются в отдельные ортогональные подпространства. Благодаря этому вклад релевантности, надёжности и риска можно проверить по отдельности, а не восстанавливать из скрытого решения другой LLM.
Из объединённого вектора MDL выводит уверенность и согласованность. Уверенность показывает общую силу сигналов, а согласованность — совпадает ли их итоговое направление с релевантной памятью. Поэтому запись может выглядеть очень подходящей, но получить низкую оценку доверия из-за конфликтующих свидетельств или высокого риска.
Риск кодируется в обратную сторону: чем опаснее задача, тем слабее релевантность влияет на итоговую уверенность. После этого пороги выбирают одно из четырёх действий: использовать память, ослабить её влияние, не передавать её модели или полностью отказаться от ответа. Обучаемых параметров у контроллера нет, но пороги и нормализацию всё равно настраивают на отдельной калибровочной выборке.
Конфликтующая память стала вредить реже
В основном опыте стандартный RAG ошибался на 53% запросов с конфликтующей памятью. MDL снизил показатель до 23,3%; разница статистически значима. На высокорисковых примерах в показанных сериях галлюцинаций не было, но этот результат достигнут прежде всего за счёт отказа отвечать, а не исправления сомнительной записи.
Контроллер добавлял около 0,14 мс на решение. Это примерно в 50 раз быстрее кодирования запроса для поиска и заметно дешевле отдельного вызова LLM для самопроверки. Такая задержка позволяет поставить MDL перед генерацией, не превращая его в узкое место контура.
Фильтр не устраняет ошибки полностью. Когда MDL разрешал активно использовать память, остаточная доля галлюцинаций составляла 8%. Значит, решение «доверять» нельзя считать гарантией правильного ответа: контроллер сокращает число опасных вставок, но не заменяет очистку хранилища и проверку результата.
Когда отдельный слой доверия меняет архитектурный план
Работа меняет план системы, если агент хранит пользовательские факты, историю действий, документы разных версий или результаты от нескольких инструментов. В таком контуре одного ранжирования по смысловой близости недостаточно: после поиска нужен отдельный шлюз, который может не пропустить запись дальше.
MDL особенно удобен там, где решение должно оставаться проверяемым. В журнал можно записать исходные сигналы, итоговую уверенность, согласованность и выбранное действие. Разбор инцидента тогда не требует выяснять, почему модель-оценщик сформулировала очередное текстовое объяснение.
Проверку проводили на TruthfulQA и HaluEval с моделями gemma-4-E4B-it, deepseek-v4-flash и gemini-3-flash-preview. Память в опытах была небольшой, риск задавали категориями и ключевыми словами, а противоречия искал лексический детектор. В зоне высокой релевантности и высокого риска точность решения на медицинских записях падала до 55,6%: сильное совпадение иногда перевешивало защитный сигнал.
Поэтому MDL разумно рассматривать не как готовую универсальную политику, а как образец архитектуры. Команде потребуется заменить эвристики риска и конфликтов правилами своего домена, откалибровать пороги на собственных ошибках и сохранить последующую проверку ответа. Главный переносимый вывод проще конкретной формулы: найденная память не должна автоматически становиться принятой памятью.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



