Журнал · Rit.work

LLM как генератор гипотез для байесовского вывода

Авторы LLM-SMC-S предлагают разделить генерацию гипотез, их формальную проверку и выбор следующего вопроса — подход интересен для исследовательских агентов, но пока не готов к промышленному внедрению.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из Cornell University и MIT разработали LLM-SMC-S — схему, в которой LLM предлагает гипотезы на естественном языке и Python, а байесовский алгоритм последовательно проверяет и пересматривает их. По замерам авторов, схема лучше воспроизводит человеческое обучение и выбор экспериментов, чем отдельная LLM или специализированные байесовские модели, хотя работа опубликована как препринт и не проходила рецензирования. Результат важен командам, которые строят исследовательских агентов, рекомендательные диалоги и системы, способные запрашивать недостающие сведения.

Что сделали

Авторы исследуют задачу последовательного обучения: система получает примеры по одному, сохраняет несколько возможных объяснений и после каждого нового наблюдения обновляет уверенность в них. Обычная LLM может сразу предложить правдоподобный ответ, но сама по себе не обязана последовательно учитывать неопределённость. Классический байесовский вывод делает это формально, однако перебор открытого множества объяснений вычислительно непрактичен.

В LLM-SMC-S эти роли разделены. Каждая гипотеза представлена описанием на естественном языке и исполняемой реализацией на Python. Язык позволяет сформулировать идею без заранее заданной предметной схемы, а код проверяет, соответствует ли она наблюдениям.

LLM используется как механизм предложения гипотез, а не как окончательный арбитр. Байесовская часть назначает им веса: априорное распределение отдаёт предпочтение коротким описаниям, а функция правдоподобия оценивает совпадение результатов программы с данными. После поступления нового примера алгоритм пересматривает набор гипотез, отбрасывает слабые и размножает варианты с большим весом.

Технически это последовательный метод Монте-Карло: он хранит ограниченный набор частиц, где каждая частица соответствует одной гипотезе. Такой набор служит приближённым распределением уверенности вместо полного перебора всех возможных программ.

Та же конструкция поддерживает активный сбор информации. LLM предлагает вопросы или эксперименты, после чего система оценивает ожидаемый прирост информации — насколько возможный ответ поможет различить конкурирующие гипотезы. Выбирается действие, которое должно сильнее всего уменьшить неопределённость.

Что показали

На задачах вывода функций над списками модели хватало 5 предложенных гипотез, чтобы лучше соответствовать средним человеческим результатам, чем специализированному поиску с бюджетом 500 000 программ. Это сравнение показывает не превосходство в универсальном программировании, а более направленный поиск в конкретном поведенческом эксперименте.

При анализе последовательной динамики LLM-SMC-S лучше остальных рассмотренных методов совпала с человеческими кривыми обучения для 70 из 100 более простых алгоритмов. Обработка всей последовательности примеров сразу через выборку по значимости давала худшее соответствие, поэтому порядок поступления данных оказался существенной частью модели.

В задачах на числовые категории схема воспроизвела эффекты привязки к ранней гипотезе и попадания в ложное направление поиска. При сокращении числа частиц привязка усиливалась, подобно поведению участников эксперимента при дополнительной когнитивной нагрузке.

В Zendo модель чередовала построение объектов с обновлением гипотез и, по оценке авторов, точнее специализированного байесовского решения описывала ошибки людей. В демонстрации с подбором товаров вопросы, выбранные по ожидаемому приросту информации, лучше выявляли предпочтение пользователя, чем обычные запросы к LLM и ReAct.

Ограничения

Работа проверяет прежде всего вычислительную модель человеческого мышления, а не готовую архитектуру промышленного агента. Эксперименты охватывают функции над списками, числовые категории, Zendo и демонстрационный сценарий подбора товаров. Они не показывают надёжность на длительных бизнес-процессах, меняющихся базах знаний, противоречивых пользовательских ответах или инструментах с необратимыми действиями.

В сценарии покупок пространство товаров заранее ограничено, а байесовское обновление вычисляется точно. Это снимает часть сложности открытых каталогов, где одновременно меняются ассортимент, атрибуты и намерение пользователя.

Авторы намеренно не сравнивают подход с современными моделями рассуждения, поскольку считают их обучение менее подходящей аналогией человеческому мышлению. Для инженерного выбора это оставляет пробел: работа не устанавливает, когда отдельный вероятностный контур выгоднее более сильной модели с инструментами. В ней также нет сравнения полной стоимости, задержки и эксплуатационной сложности вариантов.

Сами авторы отмечают ещё два ограничения: система не способна освоить то, чего уже не понимает базовая предобученная модель, и плохо подходит для быстрых процессов, которые трудно выразить словами или символическими правилами.

Что это значит

Работа не требует менять планы команд, уже строящих продукты на обычных вызовах LLM. Она не доказывает, что LLM-SMC-S даст лучшую точность или экономику в производственной среде. Переписывать существующего агента под последовательный метод Монте-Карло на основании этих экспериментов преждевременно.

Но архитектурный принцип подходит для отдельного прототипа, если системе нужно не просто отвечать, а хранить несколько объяснений, оценивать уверенность и решать, какое наблюдение запросить следующим. Это относится к диагностическим помощникам, настройке сложных продуктов, исследованию причин сбоев и сбору требований, где ранняя правдоподобная версия не должна автоматически становиться окончательной.

Практическая ценность разделения ролей состоит в контроле. LLM расширяет пространство поиска, исполняемый код связывает гипотезы с проверяемыми условиями, а вероятностный слой сохраняет конкурирующие версии. Такая схема потенциально удобнее для аудита, чем единая цепочка рассуждений, но потребует собственных замеров задержки, стоимости вызовов, качества предложенных экспериментов и устойчивости к ошибочному коду.

Рациональный следующий шаг — проверить подход на одном процессе, где стоимость лишнего вопроса и ошибочного решения уже измерима. Если вероятностный контур уменьшает число неверных действий при приемлемых вычислительных расходах, его можно выделить в специализированный компонент, не меняя всю LLM-архитектуру продукта.

Источники

Иллюстрация: рисунок из статьи «Induction and Inquiry via Probabilistic Reasoning over Language and Code», Wasu Top Piriyakulkij, Sam Acquaviva, Cassidy Langenfeld и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу