Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи University of Göttingen представили CAPA — систему, которая представляет отсутствующего участника на онлайн-встрече и решает, когда выступить от его имени. В их препринте, не проходившем рецензирования, частота пропущенных возможностей для реплики снизилась примерно в 20 раз. Работа важна для команд, которые проектируют не стенографиста или помощника по запросу, а проактивного агента с правом вмешиваться в разговор.
Что сделали
Авторы рассматривают участие во встрече как последовательность решений в условиях неполной наблюдаемости. Из текста разговора агенту нужно восстановить не только тему, но и позиции участников, уже высказанные аргументы, открытые вопросы и право на следующую реплику. Обычная подсказка с фрагментом стенограммы не превращает эти сведения в устойчивое состояние: модель должна заново извлекать их при каждом обращении.
CAPA сохраняет явное состояние встречи. Оно включает шесть элементов: активную тему, принятые решения, открытые вопросы, позиции участников, покрытие подготовленных тезисов и распределение права на реплику. Отдельно память содержит постоянный профиль представляемого человека, его роль и стиль общения, подготовленные к встрече тезисы и журнал предыдущих действий агента.
Рабочий цикл устроен следующим образом:
- Восприятие. После каждой новой реплики отдельный модуль обновляет только затронутые поля состояния. Это позволяет сохранять выводы из ранних частей разговора, не полагаясь на повторный анализ всей стенограммы.
- Прогноз. Модель предполагает, как продолжится обсуждение. Этот прогноз скрыт от модуля принятия решений и позднее используется для проверки того, правильно ли система поняла ситуацию.
- Выбор действия. Контроллер сопоставляет подготовленные тезисы с текущей темой, проверяет, не были ли они уже раскрыты, и оценивает, подходит ли момент для вмешательства. Результатом становится решение молчать либо произнести конкретное смысловое утверждение.
- Генерация. Только после выбора утверждения другой модуль формулирует его в стиле представляемого участника. Так содержание фиксируется до появления свободно сгенерированного текста.
- Перекалибровка. Когда становятся доступны следующие реплики встречи, две модели-оценщика отдельно проверяют прогноз и действие агента. Их вердикты исправляют состояние, на котором будут основаны последующие решения.
Авторы не обучают специальную модель принятия решений. CAPA представляет собой схему координации существующих LLM со структурированными полями и ограниченными форматами ответа. Поэтому отдельные стадии можно журналировать, проверять и заменять независимо.
Что показали
Основной эксперимент проведён на 137 сценарных встречах из AMI Meeting Corpus. Авторы выделили смысловые единицы, которые действительно произнёс отсутствующий участник, и проверяли, вмешался ли агент в подходящий момент и передал ли соответствующее содержание. Автоматические модели-оценщики для проверки смысла дополнительно сопоставили с человеческой разметкой.
Делегат, получавший только стенограмму и подсказку, молчал в 51,4% доступных возможностей. Для CAPA этот показатель составил 2,5%. Зачтённое восстановление — доля исходных идей участника, которые агент передал в допустимом интервале разговора, — достигло 52,2%, то есть примерно удвоилось относительно базового варианта. Доля галлюцинаций, когда реплика не опиралась на контекст участника или встречи, составила 0,6%.
По исключению компонентов авторы связывают основной эффект именно с явным состоянием. Увеличение окна сырой стенограммы не воспроизвело результат: дополнительный текст не заменил отдельное хранение позиций, покрытия тезисов и права на реплику. После добавления состояния основной тип ошибки сместился от полного молчания к выбору не самого подходящего тезиса, а источник сбоя стало возможно связать с конкретным модулем.
Ограничения
Главная проверка использует AMI — сценарные совещания о проектировании продукта с заранее заданными ролями. Исключение компонентов авторы проверяли на совпадающей подвыборке из 20 встреч, а перенос на более свободные исследовательские обсуждения ICSI — на 10 встречах. Это показывает поведение архитектуры в двух корпусах, но не подтверждает её работу на переговорах, совещаниях руководства, продажах или разговорах с юридическими последствиями.
Эксперимент воспроизводит записанные встречи: решение агента оценивается относительно уже существующего продолжения разговора. Такая схема сохраняет причинный порядок доступной информации, но не показывает, как сгенерированная реплика изменила бы ответы людей и дальнейший ход живой встречи.
В основном сравнении участвовали варианты на базе той же LLM: делегат со стенограммой, вариант с памятью о прошлых действиях и CAPA. Для системы без состояния использовали более длинное окно из 50 реплик, однако в работе нет прямого сравнения с людьми-представителями или действующими продуктами для встреч. Результат также зависит от моделей-оценщиков, хотя авторы и проверяли их согласованность с человеческой разметкой.
Что это значит
Для обычной расшифровки, подготовки итогов или ответов по запросу работа планы не меняет: таким системам не требуется самостоятельно захватывать право на реплику. Для проактивного представителя она предлагает более подходящую основу, чем одна длинная подсказка со стенограммой.
Практический вывод состоит не в выборе конкретной LLM, а в разделении системы на состояние, решение и формулировку. Команде потребуется хранить позиции и незакрытые вопросы как данные, учитывать покрытие тезисов на уровне утверждений, принимать решение о вмешательстве до генерации текста и направлять последующую обратную связь в состояние, а не только переписывать неудачную реплику.
Такая схема увеличивает число вызовов моделей на каждом цикле, но создаёт наблюдаемые точки контроля: можно выяснить, агент неверно понял разговор, выбрал неподходящий тезис или исказил его при формулировке. CAPA поэтому стоит рассматривать как архитектурную гипотезу для прототипа и испытаний на собственных встречах, а не как достаточное обоснование для автономного представительства без контроля человека.
Источники
Иллюстрация: рисунок из статьи «Speak for Me: Giving LLMs the Situational Awareness to Participate in a Meeting», Muneeb Khan, Frederic Kirstein, Terry Ruas и др., CC BY-SA 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



