Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Тесты на достаточность памяти могут проверять не наличие доказательств, а число оставшихся абзацев. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, простой счётчик абзацев оказался точнее исходной модели оценки памяти. Значит, командам с RAG и долговременной памятью агента стоит сначала пересмотреть проверочные наборы, а уже затем выбирать модель допуска к ответу.
Почему удаление доказательств раскрывает правильный ответ
Модель должна определить, хватает ли сохранённой памяти для ответа на запрос. Обычно проверочный набор строят так: берут полный контекст и удаляют из него один или несколько опорных абзацев. Получается пара из достаточной и недостаточной памяти.
У такого способа есть побочный сигнал. Полная память всегда длиннее повреждённой, поэтому модель может не сопоставлять запрос с доказательствами, а просто считать абзацы. На MuSiQue такой счётчик получил 0,979 по площади под ROC-кривой (AUROC). Эта метрика показывает, насколько хорошо оценка разделяет безопасные и небезопасные примеры независимо от выбранного порога.
Авторы заменили удалённые опорные абзацы отвлекающими, чтобы все варианты одного запроса содержали одинаковое число блоков. После выравнивания счётчик получил 0,5007 — практически уровень случайного выбора, которому соответствует 0,5. Тот же результат дал контроль, который видел только позиции блоков.
Выравнивание убирает именно утечку через количество блоков, но не гарантирует отсутствия других подсказок. Например, отвлекающий абзац может отличаться по длине или лексике. Поэтому такой набор остаётся искусственной проверкой, однако перестаёт награждать модель за самый очевидный обходной путь.
Что модель распознаёт после выравнивания памяти
Для проверки авторы собрали MemSafe. Сначала перекрёстный кодировщик MiniLM совместно обрабатывает запрос и каждый блок памяти. Отдельный проход добавляет лучший найденный блок к запросу, чтобы обнаружить доказательства второго шага, которые сами по себе могут не содержать слов из вопроса.
Затем небольшой трансформер сопоставляет блоки между собой и выдаёт вероятность того, что память небезопасна. Дополнительные выходы указывают состояние памяти, отмечают блоки с доказательствами и оценивают, сколько нужных элементов потеряно. Такой результат можно использовать не только для отказа от ответа, но и как сигнал для повторного поиска.
На выровненных наборах MemSafe получил 0,9682 на MuSiQue и 0,9831 на HotpotQA. На 2WikiMultiHopQA модели с кодировщиками почти достигли потолка, поэтому этот набор хуже различает сильные варианты метода. Лексические модели, которые опирались на совпадения слов и служебные признаки, уступили MemSafe на всех этих наборах.
Перенос оказался заметно слабее обучения и проверки на одном способе построения примеров. Модель, обученная на MuSiQue, получила 0,6393 на SQuAD 2.0, где неотвечаемые вопросы составляли люди, а не алгоритм удаления абзацев. Порог, настроенный на исходном наборе, также не сохранил заданный риск после переноса.
Меняет ли работа планы продуктовых команд
Главное изменение касается плана оценки, а не обязательной замены архитектуры. Для системы с сжатием истории, удалением старых записей или RAG недостаточно создать отрицательные примеры удалением нужных фрагментов. Следует выровнять размер памяти, добавить счётчики и другие поверхностные признаки как контрольные модели, а затем проверить перенос на другой способ повреждения контекста.
Оценку достаточности полезно отделять от уверенности модели, которая формирует ответ. В опыте с читателем на 7B параметров MemSafe снизил долю ошибок среди допущенных ответов на 22 процентных пункта при охвате 5%. Непрерывная оценка оказалась полезнее даже истинной метки целостности памяти: полный набор размеченных доказательств ещё не означает, что конкретный читатель ответит правильно.
Это не делает MemSafe готовым универсальным фильтром. Проверки охватывали MuSiQue, HotpotQA, 2WikiMultiHopQA, SQuAD 2.0 и клинические записи MIMIC-IV, но основную память строили из размеченных наборов, а не из журналов работающих агентов. Модель также обучалась на известных опорных фактах; на небольшой клинической выборке система с явно заданными признаками числовых изменений ранжировала память лучше.
Практический порядок действий получается таким: сначала исключить утечки в проверочном наборе, затем измерить перенос между разными типами потери данных и только после этого настраивать порог ответа под допустимый риск. Иначе высокий результат модели может описывать процедуру генерации тестов, а не способность заметить пропавшее доказательство.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



