Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
EpiWorld научился проверять предложенные LLM меры против эпидемии на смоделированном будущем и пересматривать решение до его применения. В нерецензированном препринте Emory University и Virginia Tech все числа получены самими авторами: замкнутый цикл сократил суммарные госпитализации в среднем на 16% по сравнению с исходным LLM-агентом. Работа показывает архитектуру для задач, где модель должна не просто написать рекомендацию, а учесть формальные ограничения и последствия действий.
LLM предлагает политику, а модель мира проигрывает последствия
Обычная LLM умеет читать протоколы и объяснять решения, но не знает, как вмешательство изменит распространение инфекции. Прогнозная модель решает другую половину задачи: продолжает наблюдаемую траекторию, но сама не выбирает действия и не работает с текстовыми правилами.
EpiWorld соединяет эти части в замкнутый цикл. LLM получает текущее состояние эпидемии, цель и допустимые меры, предлагает вмешательство и объясняет выбор. Затем эпидемиологическая модель мира (world model) рассчитывает, как при этом решении будут меняться госпитализации и другие показатели в связанных регионах.
Модель мира учитывает задержки между заражением, выявлением случая, госпитализацией и смертью. Регионы представлены графом: связи задают перемещение людей, соседство или общее давление инфекции. Выбранная мера не добавляется к наблюдениям как ещё один признак, а меняет внутреннее представление динамики — так система моделирует разные траектории для разных действий.
После такого прогона LLM получает обратную связь, уточняет политику и сохраняет вывод для следующих решений. Это отличает EpiWorld от схемы, где языковая модель один раз формирует рекомендацию, а прогноз прикладывают к ней только для справки.
Пространство действий при этом ограничено заранее. Агент выбирает именованный уровень вмешательства, который модель мира получает как числовую интенсивность. Поэтому система перебирает не произвольные тексты, а варианты, для которых задано операционное значение.
Улучшение дают накопленные уроки, а не статичная инструкция
Библиотека навыков разделяет знания на три слоя. Первый содержит жёсткие протокольные ограничения: например, допустима ли предложенная мера при текущей тяжести ситуации. Второй запускает расчётные инструменты — оценку скорости распространения, тяжести заболевания и уязвимости населения.
Третий слой хранит уроки из предыдущих симуляций. После каждого прогона система разбирает результат, связывает его с особенностями региона и эпидемической обстановки, а затем корректирует параметры аналитических инструментов. Жёсткие правила при этом не переписываются.
Полный цикл уменьшил суммарные госпитализации максимум на 59% на отдельных наборах данных и в среднем на 16% для шести базовых LLM. Лучший результат GPT-4o составил 30%, а Qwen2.5-7B — 22%. Статичная библиотека без накопления уроков почти не изменила результат исходного агента: основную прибавку дала обратная связь из симуляций.
Отдельное правило, которое выбирало меры пропорционально тяжести эпидемии, уступило LLM при сопоставимой интенсивности вмешательств. Значит, выигрыш возник не потому, что EpiWorld постоянно выбирал более строгие ограничения, а благодаря времени и адресности мер.
Модель мира также показала наименьшую среднюю абсолютную ошибку высоты пика на регионах, которые не входили в обучение. Авторы повторно исполнили политики в исходном механистическом симуляторе, и порядок методов сохранился. Это снижает риск, что агент просто нашёл слабое место собственной модели мира.
Когда схема меняет архитектурный план
Работа предлагает полезное разделение ответственности. LLM читает правила, собирает аргументы и формирует понятное человеку действие. Отдельная модель рассчитывает динамику системы, детерминированный слой отсекает недопустимые варианты, а журнал прошлых прогонов постепенно улучшает выбор.
Такая схема меняет план разработки policy-агента, если его действия влияют на следующие наблюдения. Одной базы знаний и хорошего запроса к LLM недостаточно: команде понадобится модель перехода между состояниями, возможность быстро проигрывать альтернативы и механизм, который не позволит накопленным урокам изменить обязательные правила.
Переносить сохранённые уроки между средами автоматически нельзя. В экспериментах они работали между штатами внутри одного режима инфекции, но ухудшали решения при переходе к другому режиму. Для каждой новой обстановки нужен отдельный набор уроков, связанный с той же моделью мира и тем же пространством действий.
Проверяли ретроспективные данные COVID-19 и Influenza, синтетические сценарии и симуляторы, а не работу при живой эпидемии. Модель также опирается на сочетания действий, представленные в исторических данных; за их пределами она экстраполирует. Поэтому EpiWorld остаётся системой поддержки решений: эксперт утверждает меры и отвечает за факторы, которых нет в модели, включая политические, экономические и поведенческие ограничения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



