Журнал · Rit.work

LLM кодируют вероятности скрытых состояний в активациях

Эксперимент со скрытыми марковскими моделями показал, что LLM по контексту отслеживают вероятности скрытых состояний и используют их для следующего предсказания.

Rit.work
Студия разработки
16 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM по примерам в запросе формируют внутреннюю карту вероятностей скрытых причин наблюдаемой последовательности. В препринте Daniel Balcells и коллег, который не прошёл рецензирование и где числа получили сами авторы, линейная модель восстанавливала эту карту из активаций с коэффициентом детерминации R² от 0,83 до 0,99 — то есть объясняла большую часть разброса целевого состояния.

Эту способность называют обучением по контексту (in-context learning): модель подстраивает предсказания под примеры в запросе, не меняя своих весов. LLM подавали последовательности от скрытых марковских моделей, где наблюдаемые токены зависят от недоступного напрямую состояния. По истории токенов можно вычислить распределение вероятностей возможных состояний — его авторы называют состоянием убеждений.

Затем это распределение искали в общем потоке активаций между слоями. Оно линейно считывалось у разных сочетаний LLM и генераторов данных, причём лучший слой располагался в разных частях сети — от ранних до поздних. Такой результат согласуется с байесовским объяснением: по мере поступления токенов модель обновляет вероятности скрытых состояний и использует их для следующего предсказания.

Одного совпадения активаций было бы недостаточно, поэтому найденное подпространство подменяли и направленно сдвигали. После вмешательства качество последующих предсказаний оставалось на уровне исходной модели, тогда как контрольные вмешательства заметно его ухудшали. Значит, найденное представление не просто коррелирует с ответом, а участвует в вычислении.

Проверка охватила шесть открытых LLM и 40 скрытых марковских моделей с нетривиальной структурой состояний; поскольку заметка опирается только на абстракт, названия LLM и точную схему вмешательств из него восстановить нельзя. Для выбора модели результат пока не даёт нового прикладного критерия, но показывает, что анализ внутренних активаций может выявлять состояние процесса, которое LLM строит прямо из контекста.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу