Журнал · Rit.work

MemCalib проверяет, когда агенту не стоит доверять собственной памяти

MemCalib измеряет, как LLM-агенты дозируют влияние памяти, а MemCalib-RL исправляет перекос между её чрезмерным и недостаточным использованием.

Rit.work
Студия разработки
22 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появился способ проверять и обучать LLM-агентов так, чтобы они точнее дозировали влияние памяти на ответ. Хотя работу не рецензировали и числа получили сами авторы, даже лучший из проверенных сервисов правильно использовал все переданные факты лишь в 28,4% ответов. Командам, которые строят агентов с профилями пользователей, историей задач или накопленным опытом, стоит проверять не только поиск по памяти, но и её фактическое влияние на результат.

Память оценивают по влиянию каждого утверждения

Обычная проверка системы памяти отвечает на вопрос, нашла ли она подходящую запись. MemCalib проверяет следующий этап: насколько сильно каждое найденное утверждение изменило ответ модели.

Для утверждения задают один из трёх целевых уровней. Модель должна проигнорировать шум, использовать полезную деталь только локально либо позволить критичному ограничению определить вывод. Ошибка возникает в обе стороны: агент может подчинить ответ устаревшей записи или, наоборот, не учесть обязательное условие.

Например, память агента может одновременно содержать предпочтение пользователя, старый факт и ограничение текущей задачи. Недостаточно применить блок целиком или отбросить его: модель должна по-разному обработать отдельные утверждения внутри одного связного текста.

В MemCalib вошли 15 000 примеров, собранных из открытых наборов вопросов и ответов по медицине, общей помощи и программированию. Для итоговой проверки отделили 1 500 примеров. Специальная модель-оценщик читает ответ по отдельным критериям для каждого утверждения и определяет, проигнорировала ли его модель, использовала локально или сделала основой вывода.

Лучший общий результат показал GPT-5.6-SOL: его балл калибровки составил 46,25 из 100. У Claude Sonnet 4.6 он равен 36,44. Такой балл одновременно штрафует за чрезмерное и недостаточное влияние памяти, поэтому хорошее поведение в одном направлении не компенсирует ошибки в другом.

Размер модели сам по себе проблему не решает. Qwen3-8B получил более высокий общий балл, чем Qwen3.5-35B-A3B. Большинство проверенных моделей чаще переоценивали память, а Qwen3-8B, напротив, чаще недооценивал её.

Одна награда раскачивает модель между двумя ошибками

Стандартное дообучение сводит качество всего ответа к общей награде и одинаково распределяет её по сгенерированным токенам. Если ответ правильно применил одно воспоминание, проигнорировал второе и подчинился нерелевантному третьему, сигнал не показывает, какие фрагменты текста следует усилить, а какие подавить.

В экспериментах GRPO и самостоятельная дистилляция на ответах самой модели улучшали одну сторону поведения ценой другой. Модель начинала осторожнее обращаться с памятью, но чаще пропускала нужные ограничения, либо лучше учитывала полезные сведения, но переносила их влияние туда, где они не нужны.

MemCalib-RL разделяет награду по типам правильного и ошибочного использования памяти. Затем алгоритм по очереди удаляет отдельные утверждения, оставляет ответ неизменным и сравнивает вероятность его токенов с полной и сокращённой памятью. Так он находит участки ответа, которые конкретное утверждение поддержало или, наоборот, пыталось подавить.

Награда после этого достаётся не всему ответу поровну, а связанным с утверждением токенам. При слабом или неоднозначном сигнале алгоритм возвращается к награде за ответ целиком, чтобы неточная локализация не управляла обучением.

MemCalib-RL обошёл GRPO и самостоятельную дистилляцию на Qwen3-8B, Ministral-3-8B-Instruct и Qwen3.5-35B-A3B. Улучшение сохранилось на внешнем тесте RPEval без дополнительного обучения, то есть метод не свёлся к запоминанию устройства MemCalib.

Архитектуру агента менять рано, проверку памяти — уже стоит

Работа не показывает, что MemCalib-RL нужно сразу включать в рабочий контур. Его проверяли на трёх семействах моделей и задачах из медицины, общей помощи и программирования; примеры строили автоматическим конвейером, а ответы в основном оценивала другая LLM. Человеческая проверка подтвердила совпадение оценок в 96,7% случаев, но граница между локальным влиянием и влиянием на основной вывод осталась самым спорным местом.

Практический вывод касается прежде всего испытаний агента. Набора вопросов на поиск нужной записи недостаточно: в него стоит добавлять смешанные блоки с полезными, критичными и устаревшими утверждениями, а затем отдельно измерять чрезмерное и недостаточное влияние.

Особенно это относится к системам, где память содержит предпочтения пользователя, прошлые решения или ограничения длительного процесса. Средний показатель качества может скрыть два разных дефекта: агент либо слепо доверяет истории, либо почти не использует её. MemCalib предлагает разделить эти режимы до того, как выбирать модель или менять механизм поиска.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу