Журнал · Rit.work

LLM помнят обновление, но отвечают устаревшим значением

Эксперименты показывают, почему старые значения вытесняют актуальное состояние из ответа LLM и как перенаправить внимание модели без переобучения.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM могут хранить актуальное значение во внутреннем состоянии, но выбирать для ответа старую версию из истории. В препринте Junyu Guo и соавторов, который не рецензирован, а все числа в нём получили сами авторы, 331 из 333 ошибок в синтетическом тесте возвращали прежнее значение нужной переменной. Для агентов полная история изменений поэтому не гарантирует правильного текущего состояния.

Для проверки создали CICM — набор задач с последовательными изменениями предпочтений, ограничений и состояния процессов. Ответы разделяли на актуальные, устаревшие, относящиеся к другой переменной и прочие. Контрольные примеры той же длины, но без перезаписи значений, модели проходили лучше: проблема возникала из-за конкурирующих обновлений, а не только из-за длинного контекста.

Текущее значение при ошибке не исчезало. Простой классификатор мог извлечь его из скрытого состояния модели, однако внимание — механизм выбора значимых фрагментов контекста — отдавало больший вес старым присваиваниям. В Qwen доля внимания к ним была на 19,4 процентного пункта выше при ошибочных ответах. Несколько прежних значений вместе могли перевесить одно актуальное, даже если каждое по отдельности не выглядело главным.

Авторы перенаправили внимание на фрагмент с текущим значением без изменения весов модели. Вмешательство меняло ответы у Qwen, Llama, Mistral и Gemma; для каждого запроса его силу подбирали отдельно. Такой способ требует доступа к внутренним состояниям, размеченных примеров для настройки и разборщика, который отличает актуальное значение от отменённых.

Работу проверяли на контролируемых диалогах, решениях с изменившимися ограничениями и операционных журналах. На сложных историях GPT-5.6 Sol правильно ответил на 9 из 40 запросов, а Claude Opus 4.8 — на 18 из 40; парные снимки уже вычисленного текущего состояния обе модели прочитали без ошибок. Практический вывод для архитектуры агента: состояние стоит хранить отдельно и передавать модели его актуальный снимок, а не рассчитывать, что она восстановит его из полного журнала.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу