Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
В реальных разговорах ИИ-компаньону редко нужна долгая память, а тестовые вопросы часто сами подсказывают, что следует искать в прошлом. Хотя работу Arman Behnam, Sunglyoung Kim и Liangwei Yang ещё не рецензировали и числа получили сами авторы, в случайной выборке прошлые диалоги потребовались только для 3,4% сообщений. Поэтому система, хорошо решающая задачи на извлечение фактов, не обязательно правильно выбирает момент для обращения к памяти.
RealCompanion включает десять отношений пользователей с ИИ-компаньоном: 27 218 сообщений за периоды до 120 дней. Для каждого участника выпущены исходный диалог, профиль с заявленными фактами, описание черт и решений человека, эталонные ответы и набор вопросов. Все производные записи ссылаются на сообщения, на которых они основаны; тексты обезличили и переписали с сохранением смысла и структуры общения.
Когда прошлое всё же требовалось, нужная реплика находилась в медиане на 2 157 сообщений раньше. Простое окно последних сообщений поэтому может выглядеть убедительно на общей выборке, где почти всегда достаточно текущей темы, но пропускать редкие случаи, ради которых память и строят. Проверенные способы определить такие случаи не смогли надёжно отделить их от сообщений, не требующих истории.
Отдельный перекос создаёт утечка подсказки: составленный для теста вопрос чаще повторяет слова из нужного фрагмента, чем настоящая реплика пользователя. Даже название контекста меняет поведение модели. Если те же десять сообщений назвать «извлечёнными воспоминаниями», а не «предыдущими репликами», модель использует их на 10–14 процентных пунктов чаще, в том числе когда память не нужна.
Границы результата задаёт сам корпус: десять пользователей, причём две самые длинные истории содержат 73% сообщений. На восстановлении описания личности также проверили три агентные системы. Они показали почти одинаковую F1-меру, которая объединяет точность и полноту, при 31-кратной разнице в затратах. Для оценки продукта из этого следует разделять три теста: нашла ли система нужный факт, поняла ли, когда он нужен, и не навязала ли прошлое текущему разговору.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



