Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
После серии точечных обновлений LLM хуже отличает надёжный документ от ложного, хотя обычный тест способностей не замечает ущерба. В работе Atul Anand, которая не проходила рецензирование и содержит его собственные замеры, после 1 000 правок разброс оценок внешних свидетельств у Qwen2.5-7B-Instruct сократился на 36%. Продукт может сохранить точность без поиска, но стать менее предсказуемым при работе с базой знаний.
Редактирование знаний точечно переписывает факты в весах модели без полного переобучения. Чтобы проверить скрытый эффект, Anand брал факты, которых правки не касались, и сталкивал ответ из памяти модели с другим ответом в документе. Запрос, документ и оба варианта ответа оставались прежними, поэтому замер показывал именно изменение в выборе источника.
После щадящего редактирования через LoRA результат на MMLU — тесте общих знаний и рассуждения — совпал с исходным до четвёртого знака. При этом модель хуже ранжировала решения по уверенности: механизм, который должен пропускать сомнительные ответы, стал менее полезен. Случайное изменение весов сопоставимого масштаба почти не давало такого эффекта, поэтому его нельзя объяснить только общим ухудшением модели.
В опыте с поиском использовали один и тот же набор найденных документов для каждого состояния модели. Точность ответов упала с 59,2% до 46%: изменилось не качество поиска, а то, как LLM обращалась с полученными материалами. Значит, проверять только успешность записи нового факта и сохранность соседних ответов недостаточно — нужен отдельный тест на конфликт между памятью модели и внешним источником.
Эффект проверяли на Qwen2.5-7B-Instruct и Mistral-7B-Instruct-v0.3, наборах CounterFact и ZsRE, а также методах LoRA, MEMIT и AlphaEdit. Факты для проверки не пересекались по субъектам с потоком правок; результат повторился с перефразированными запросами и разными шаблонами. Опыт с поиском был намеренно жёстким: для каждого запроса модель получала правильный, устаревший и вводящий в заблуждение документы, поэтому величину падения нельзя напрямую переносить на обычный продукт.
Источники
Иллюстрация: рисунок из статьи «Sequential knowledge editing breaks a model's ability to tell good evidence from bad, without costing it accuracy», Atul Anand, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



