Журнал · Rit.work

CAPA: зачем агенту-представителю явное состояние встречи

Архитектура CAPA отделяет отслеживание встречи, выбор момента для реплики и генерацию текста, сокращая пропуски без обучения отдельной модели.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи University of Göttingen представили CAPA — систему, которая представляет отсутствующего участника на онлайн-встрече и решает, когда выступить от его имени. В их препринте, не проходившем рецензирования, частота пропущенных возможностей для реплики снизилась примерно в 20 раз. Работа важна для команд, которые проектируют не стенографиста или помощника по запросу, а проактивного агента с правом вмешиваться в разговор.

Что сделали

Авторы рассматривают участие во встрече как последовательность решений в условиях неполной наблюдаемости. Из текста разговора агенту нужно восстановить не только тему, но и позиции участников, уже высказанные аргументы, открытые вопросы и право на следующую реплику. Обычная подсказка с фрагментом стенограммы не превращает эти сведения в устойчивое состояние: модель должна заново извлекать их при каждом обращении.

CAPA сохраняет явное состояние встречи. Оно включает шесть элементов: активную тему, принятые решения, открытые вопросы, позиции участников, покрытие подготовленных тезисов и распределение права на реплику. Отдельно память содержит постоянный профиль представляемого человека, его роль и стиль общения, подготовленные к встрече тезисы и журнал предыдущих действий агента.

Рабочий цикл устроен следующим образом:

  1. Восприятие. После каждой новой реплики отдельный модуль обновляет только затронутые поля состояния. Это позволяет сохранять выводы из ранних частей разговора, не полагаясь на повторный анализ всей стенограммы.
  2. Прогноз. Модель предполагает, как продолжится обсуждение. Этот прогноз скрыт от модуля принятия решений и позднее используется для проверки того, правильно ли система поняла ситуацию.
  3. Выбор действия. Контроллер сопоставляет подготовленные тезисы с текущей темой, проверяет, не были ли они уже раскрыты, и оценивает, подходит ли момент для вмешательства. Результатом становится решение молчать либо произнести конкретное смысловое утверждение.
  4. Генерация. Только после выбора утверждения другой модуль формулирует его в стиле представляемого участника. Так содержание фиксируется до появления свободно сгенерированного текста.
  5. Перекалибровка. Когда становятся доступны следующие реплики встречи, две модели-оценщика отдельно проверяют прогноз и действие агента. Их вердикты исправляют состояние, на котором будут основаны последующие решения.

Авторы не обучают специальную модель принятия решений. CAPA представляет собой схему координации существующих LLM со структурированными полями и ограниченными форматами ответа. Поэтому отдельные стадии можно журналировать, проверять и заменять независимо.

Что показали

Основной эксперимент проведён на 137 сценарных встречах из AMI Meeting Corpus. Авторы выделили смысловые единицы, которые действительно произнёс отсутствующий участник, и проверяли, вмешался ли агент в подходящий момент и передал ли соответствующее содержание. Автоматические модели-оценщики для проверки смысла дополнительно сопоставили с человеческой разметкой.

Делегат, получавший только стенограмму и подсказку, молчал в 51,4% доступных возможностей. Для CAPA этот показатель составил 2,5%. Зачтённое восстановление — доля исходных идей участника, которые агент передал в допустимом интервале разговора, — достигло 52,2%, то есть примерно удвоилось относительно базового варианта. Доля галлюцинаций, когда реплика не опиралась на контекст участника или встречи, составила 0,6%.

По исключению компонентов авторы связывают основной эффект именно с явным состоянием. Увеличение окна сырой стенограммы не воспроизвело результат: дополнительный текст не заменил отдельное хранение позиций, покрытия тезисов и права на реплику. После добавления состояния основной тип ошибки сместился от полного молчания к выбору не самого подходящего тезиса, а источник сбоя стало возможно связать с конкретным модулем.

Ограничения

Главная проверка использует AMI — сценарные совещания о проектировании продукта с заранее заданными ролями. Исключение компонентов авторы проверяли на совпадающей подвыборке из 20 встреч, а перенос на более свободные исследовательские обсуждения ICSI — на 10 встречах. Это показывает поведение архитектуры в двух корпусах, но не подтверждает её работу на переговорах, совещаниях руководства, продажах или разговорах с юридическими последствиями.

Эксперимент воспроизводит записанные встречи: решение агента оценивается относительно уже существующего продолжения разговора. Такая схема сохраняет причинный порядок доступной информации, но не показывает, как сгенерированная реплика изменила бы ответы людей и дальнейший ход живой встречи.

В основном сравнении участвовали варианты на базе той же LLM: делегат со стенограммой, вариант с памятью о прошлых действиях и CAPA. Для системы без состояния использовали более длинное окно из 50 реплик, однако в работе нет прямого сравнения с людьми-представителями или действующими продуктами для встреч. Результат также зависит от моделей-оценщиков, хотя авторы и проверяли их согласованность с человеческой разметкой.

Что это значит

Для обычной расшифровки, подготовки итогов или ответов по запросу работа планы не меняет: таким системам не требуется самостоятельно захватывать право на реплику. Для проактивного представителя она предлагает более подходящую основу, чем одна длинная подсказка со стенограммой.

Практический вывод состоит не в выборе конкретной LLM, а в разделении системы на состояние, решение и формулировку. Команде потребуется хранить позиции и незакрытые вопросы как данные, учитывать покрытие тезисов на уровне утверждений, принимать решение о вмешательстве до генерации текста и направлять последующую обратную связь в состояние, а не только переписывать неудачную реплику.

Такая схема увеличивает число вызовов моделей на каждом цикле, но создаёт наблюдаемые точки контроля: можно выяснить, агент неверно понял разговор, выбрал неподходящий тезис или исказил его при формулировке. CAPA поэтому стоит рассматривать как архитектурную гипотезу для прототипа и испытаний на собственных встречах, а не как достаточное обоснование для автономного представительства без контроля человека.

Источники

Иллюстрация: рисунок из статьи «Speak for Me: Giving LLMs the Situational Awareness to Participate in a Meeting», Muneeb Khan, Frederic Kirstein, Terry Ruas и др., CC BY-SA 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу