Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Появилась архитектура, которая отделяет оценку скрытого состояния среды от выбора следующего действия LLM-агентом. В двух тестовых средах Belief-State Engine обошёл шесть подходов по суммарной награде, точности вероятностей и стабильности решений, хотя препринт не рецензирован и числа получили сами авторы. Для продукта это меняет границу ответственности: модель можно оставить интерфейсом выбора действий, а работу с неопределённостью вынести в проверяемый модуль.
Belief-State Engine, или BSE, хранит распределение вероятностей по скрытым состояниям частично наблюдаемого марковского процесса принятия решений (POMDP). После каждого действия и наблюдения модуль пересчитывает вероятности по правилу Байеса. LLM получает только текущее распределение и выбирает действие, но не видит журнал предыдущих шагов.
Так два разных журнала, которые приводят к одинаковым вероятностям состояний, дают модели одинаковый вход. Авторы формализовали это четырьмя требованиями и доказали, что связка BSE и LLM становится марковской политикой: решение зависит от текущего распределения, а не от формулировок и длины истории. Доказательство не делает саму LLM оптимальным планировщиком — оно гарантирует корректное представление состояния, на котором можно применять классические методы планирования.
BSE проверили на задаче Tiger с двумя скрытыми состояниями и на графе кибератаки размером до 64 состояний. Систему сравнили с реактивным агентом, Chain-of-Thought, ReAct, текстовым учётом уверенности, QMDP и POMCP; отдельный прогон на модели с открытыми весами показал, что результат не привязан к одному поставщику LLM.
В экспериментах BSE точно знал правила переходов между состояниями и вероятность наблюдений, поэтому мог пересчитывать распределение без приближений. В продукте такую схему проще применить там, где среду можно явно описать: например, в диагностике, управлении оборудованием или сценариях реагирования. Для больших либо неизвестных пространств потребуется приближённый фильтр или модель, обученная на данных, а формальная гарантия будет зависеть от её ошибки.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



