Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Агента научили проверять, достаточно ли надёжна его модель мира для конкретного действия, и при сомнении сначала собирать подтверждения. В нерецензированном препринте, где все числа получили сами авторы, такой фильтр повысил среднюю долю успешных задач примерно на 11 процентных пунктов по сравнению с лучшим альтернативным правилом. Для архитектуры агента это означает, что модель мира не нужно считать надёжной или ненадёжной целиком: доступ к её советам можно выдавать отдельно для каждого решения.
Одна и та же история взаимодействия не позволяет установить, кто испортил результат: правило принятия решений или модель мира (world model), которая неверно предсказала последствия. Dual-Frontier сравнивает ожидаемую пользу правки с двумя запасами на ошибку — неточностью самой модели и неопределённостью оценки. Агент принимает правку, только если польза перекрывает оба запаса; иначе бюджет направляют на проверку прогноза.
В контролируемых средах такой отбор снизил долю вредных применений модели с 5,10% до 0,30%. В тестах с инструментами Dual-Frontier также улучшил и долю выполненных задач, и точность параметров вызова API. Все правила получали одинаковую исходную команду, одну и ту же предложенную правку, одинаковые подсказки и вычислительный бюджет, поэтому разницу дал именно способ допуска.
Метод проверяли в небольших средах с 16 состояниями и четырьмя действиями, а затем на BFCL v4, API-Bank и NexusRaven. В публичной части Qwen-AgentWorld предлагал исправления для агентов на базе Llama-3.1-8B-Instruct и Qwen3-8B, а фильтр решал, сохранить исходное действие или принять фиксированную правку. Такой масштаб подтверждает работу правила маршрутизации между двумя готовыми вариантами; математическая гарантия действует, когда оценка ошибки модели соответствует условиям работы.
Источники
Иллюстрация: рисунок из статьи «Dual-Frontier: When Can an Agent Trust Its World Model?», Huatai Zhu, Qiang Chen, Ziqian Kou и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



