Журнал · Rit.work

Редактирование знаний сбивает выбор источника у LLM

После тысячи точечных правок модель сохраняет результат на MMLU, но хуже решает, доверять собственной памяти или найденному документу.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

После серии точечных обновлений LLM хуже отличает надёжный документ от ложного, хотя обычный тест способностей не замечает ущерба. В работе Atul Anand, которая не проходила рецензирование и содержит его собственные замеры, после 1 000 правок разброс оценок внешних свидетельств у Qwen2.5-7B-Instruct сократился на 36%. Продукт может сохранить точность без поиска, но стать менее предсказуемым при работе с базой знаний.

Редактирование знаний точечно переписывает факты в весах модели без полного переобучения. Чтобы проверить скрытый эффект, Anand брал факты, которых правки не касались, и сталкивал ответ из памяти модели с другим ответом в документе. Запрос, документ и оба варианта ответа оставались прежними, поэтому замер показывал именно изменение в выборе источника.

После щадящего редактирования через LoRA результат на MMLU — тесте общих знаний и рассуждения — совпал с исходным до четвёртого знака. При этом модель хуже ранжировала решения по уверенности: механизм, который должен пропускать сомнительные ответы, стал менее полезен. Случайное изменение весов сопоставимого масштаба почти не давало такого эффекта, поэтому его нельзя объяснить только общим ухудшением модели.

В опыте с поиском использовали один и тот же набор найденных документов для каждого состояния модели. Точность ответов упала с 59,2% до 46%: изменилось не качество поиска, а то, как LLM обращалась с полученными материалами. Значит, проверять только успешность записи нового факта и сохранность соседних ответов недостаточно — нужен отдельный тест на конфликт между памятью модели и внешним источником.

Эффект проверяли на Qwen2.5-7B-Instruct и Mistral-7B-Instruct-v0.3, наборах CounterFact и ZsRE, а также методах LoRA, MEMIT и AlphaEdit. Факты для проверки не пересекались по субъектам с потоком правок; результат повторился с перефразированными запросами и разными шаблонами. Опыт с поиском был намеренно жёстким: для каждого запроса модель получала правильный, устаревший и вводящий в заблуждение документы, поэтому величину падения нельзя напрямую переносить на обычный продукт.

Источники

Иллюстрация: рисунок из статьи «Sequential knowledge editing breaks a model's ability to tell good evidence from bad, without costing it accuracy», Atul Anand, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу