Журнал · Rit.work

Как собрать агента для когнитивной стимуляции по протоколу

RCA разделяет разговорного агента на синтез обучающих диалогов, планирование по протоколу и выбор самого безопасного ответа из нескольких вариантов.

Rit.work
Студия разработки
17 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Разговорного агента научили поддерживать пожилых людей с когнитивными нарушениями, не теряя правила когнитивной стимуляции в многостороннем диалоге. Jiyue Jiang и его коллеги показали улучшение эмпатии и безопасности на всех проверенных моделях, хотя работа не рецензирована, а числа получили сами авторы. Для прикладной команды здесь важен не новый класс моделей, а архитектура: отдельно подготовить данные, спланировать реплику по протоколу и отсеять рискованные варианты перед отправкой.

Синтетический диалог сохраняет структуру реальной сессии

Первую часть системы назвали STaR-CS. Она превращает обезличенные сессии когнитивной стимуляции в синтетический корпус на кантонском языке, где особенно трудно собрать чувствительные медицинские разговоры.

Сначала система выделяет из реплик ведущего карточку стиля: тон, характерные конструкции, используемые принципы и запреты. Затем каждый исходный диалог сворачивается в каркас. Для очередного хода в нём остаются говорящий, адресат, тип действия и краткое содержание, но исчезает исходная формулировка.

Каркас фиксирует порядок событий и смену говорящих. Это отличает подход от свободной генерации похожих бесед: модель получает не только тему, но и план того, кто задаёт вопрос, отвечает, выражает эмоцию или возвращает группу к занятию.

К каркасу добавляют сцену и профили виртуальных участников с биографией, когнитивным состоянием и чертами личности. После этого модель заново пишет разговор в стиле ведущего и размечает эмоции, применённую стратегию, принципы стимуляции и состояние участника.

Так собрали корпус из 20 000 групповых сессий. В среднем диалог содержит 29 реплик ведущего и 3–6 виртуальных пожилых участников. Такая схема полезна там, где реальные записи нельзя напрямую использовать для массового обучения, но эксперт может проверить стиль, каркас и правила синтеза.

Агент сначала выбирает стратегию, затем формулирует ответ

Вторая часть, RCA, работает уже во время разговора. Она рассматривает сессию как последовательность решений: наблюдаемый диалог даёт лишь косвенные признаки эмоций, вовлечённости и когнитивного состояния, а каждая реплика должна учитывать не только немедленное успокоение, но и дальнейший ход занятия.

Перед ответом модель проходит три шага. Она оценивает состояние участников, выбирает подходящие принципы когнитивной стимуляции и составляет смысловой план реплики. В инструкции отдельно запрещены вопросы, которые превращают беседу в проверку памяти.

Одного плана недостаточно: корректно выбранную стратегию модель может выразить опасно или механически. Поэтому RCA генерирует четыре варианта ответа и передаёт их оценщику. Тот сравнивает безопасность, соответствие выбранной стратегии и эмпатию, причём безопасность и правила получают больший приоритет, чем общая теплота формулировки.

Для групповой сессии агент хранит недавние реплики отдельно от долгосрочных сведений об участниках. Короткая память помогает продолжить текущий обмен, а устойчивый профиль не даёт потерять личные особенности человека после смены темы.

Разбор опасного сценария показывает практический смысл отбора. Когда участник с деменцией тревожится из-за умершей матери, обычная модель может прямо исправить его или, наоборот, поддержать заблуждение. RCA выбрала реплику, которая сначала снижает риск, затем признаёт эмоцию и переводит внимание на знакомые человеку ощущения и профессиональный опыт.

Планы меняет слой контроля, а не сама модель

RCA проверяли на шести базовых моделях, включая GPT-4o, GPT-5, GLM-4.7 и DeepSeek-v3.2. Сравнивали обычный запрос, запрос с примерами, пошаговое рассуждение и полный конвейер. Ответы оценивали две независимые модели-оценщика и люди.

В человеческой оценке безопасность выросла на 1,9–2,3 балла относительно обычного запроса, а эмпатия — на 1,0–1,7 балла. Выигрыш повторился на каждой базовой модели. При этом на GPT-4o естественность речи снизилась на 0,15 балла: жёсткий протокол иногда делает ответ менее свободным.

Для команды это аргумент не в пользу немедленной смены LLM, а в пользу отдельного слоя принятия решений. Прототип можно строить вокруг доступной модели: формализовать наблюдаемое состояние, допустимые стратегии и запреты, затем генерировать несколько кандидатов и выбирать один по составной оценке. Такой путь не требует обновлять веса модели во время работы.

Цена схемы — дополнительная задержка и расход токенов: каждый ход включает планирование, несколько генераций и оценку. Поэтому число кандидатов и сложность оценщика становятся параметрами продукта, а не только исследовательскими настройками.

Проверка охватывает синтетические кантонские групповые диалоги и качество отдельных ответов. Человеческое исследование включало ограниченный круг пожилых людей и ухаживающих за ними специалистов, а не длительные терапевтические результаты. RCA стоит рассматривать как поддержку ведущего или контролируемого собеседника с передачей опасных случаев человеку, а не как замену клиницисту.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу