Журнал · Rit.work

LLM-агенту оставили решения, а неопределённость вынесли наружу

Belief-State Engine заменяет текстовую память LLM-агента явным распределением вероятностей и делает его поведение формально совместимым с классическим планированием.

Rit.work
Студия разработки
10 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появилась архитектура, которая отделяет оценку скрытого состояния среды от выбора следующего действия LLM-агентом. В двух тестовых средах Belief-State Engine обошёл шесть подходов по суммарной награде, точности вероятностей и стабильности решений, хотя препринт не рецензирован и числа получили сами авторы. Для продукта это меняет границу ответственности: модель можно оставить интерфейсом выбора действий, а работу с неопределённостью вынести в проверяемый модуль.

Belief-State Engine, или BSE, хранит распределение вероятностей по скрытым состояниям частично наблюдаемого марковского процесса принятия решений (POMDP). После каждого действия и наблюдения модуль пересчитывает вероятности по правилу Байеса. LLM получает только текущее распределение и выбирает действие, но не видит журнал предыдущих шагов.

Так два разных журнала, которые приводят к одинаковым вероятностям состояний, дают модели одинаковый вход. Авторы формализовали это четырьмя требованиями и доказали, что связка BSE и LLM становится марковской политикой: решение зависит от текущего распределения, а не от формулировок и длины истории. Доказательство не делает саму LLM оптимальным планировщиком — оно гарантирует корректное представление состояния, на котором можно применять классические методы планирования.

BSE проверили на задаче Tiger с двумя скрытыми состояниями и на графе кибератаки размером до 64 состояний. Систему сравнили с реактивным агентом, Chain-of-Thought, ReAct, текстовым учётом уверенности, QMDP и POMCP; отдельный прогон на модели с открытыми весами показал, что результат не привязан к одному поставщику LLM.

В экспериментах BSE точно знал правила переходов между состояниями и вероятность наблюдений, поэтому мог пересчитывать распределение без приближений. В продукте такую схему проще применить там, где среду можно явно описать: например, в диагностике, управлении оборудованием или сценариях реагирования. Для больших либо неизвестных пространств потребуется приближённый фильтр или модель, обученная на данных, а формальная гарантия будет зависеть от её ошибки.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу