Журнал · Rit.work

Персонализация LLM-агента упирается не только в память

Эксперименты с персональными LLM-агентами показали, почему расширение памяти и повторные обновления не гарантируют точного соблюдения предпочтений пользователя.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Расширение памяти и повторная самонастройка не гарантируют, что LLM-агент лучше усвоит предпочтения пользователя. В работе Renmin University of China лучшие алгоритмы после 24 взаимодействий нарушали правила примерно в семь раз чаще эталона: 0,48 против 0,071, однако препринт пока не рецензирован, а числа получили сами авторы. Для продукта это разделяет три причины ошибок: неподходящую архитектуру, лишний контекст и неточную процедуру обновления.

Авторы изучили обвязку агента (agent harness) — слой вокруг неизменяемой LLM, который собирает контекст, хранит память, подключает инструменты и контролирует действия. Они разложили ошибки персонализации на три группы: обвязка в принципе не умеет выразить нужное правило; объём памяти не соответствует накопленному опыту; алгоритм неверно перерабатывает обратную связь.

Текстовая память справлялась с локальными требованиями вроде подписи в сообщении или шаблона платёжной заметки. Правила, которым нужны точные вычисления, история действий или вмешательство в вызов API, надёжнее исполняла управляющая обвязка. Поэтому хранить требование «считать общую сумму расходов» в системной инструкции недостаточно: агенту нужен отдельный счётчик или проверка действия.

Увеличение памяти давало немонотонный результат: новые инструкции могли помогать, а затем мешать уже сохранённым правилам. Практический вывод — оценивать не длину контекста, а соблюдение каждого правила на отложенных задачах и удалять конфликтующие записи.

Проверку провели в AppWorld-P — среде с повседневными задачами через API и программно проверяемыми предпочтениями. Во всех опытах использовали claude-haiku-4-5-20251001; сравнивали текстовую и управляющую обвязки, память разного размера и четыре способа самонастройки. Результаты относятся к одной модели, заданным наборам предпочтений и симулированным приложениям, но дают полезную схему диагностики: сначала проверить, может ли архитектура выполнить правило, затем подобрать объём памяти и только после этого менять алгоритм обновления.

Источники

Иллюстрация: рисунок из статьи «Harness Evolution as Learning: Approximation, Generalization, and Optimization Limits of Self-Improving Personal Agents», Zeyu Gan, Zixuan Gong, Yong Liu, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу