Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Вероятность правильного ответа LLM научились оценивать по внутренним состояниям за тот же прогон, в котором модель пишет ответ. В препринте Jacopo Dardini и Roberta Calegari из University of Bologna, который не прошёл рецензирование и содержит замеры самих авторов, ActMap обошёл все проверенные методы без плотных тензоров активаций и сравнялся в среднем с ACT-ViT при представлении в 67 раз меньше. Такой сигнал позволяет отправлять отдельные ответы на проверку или другой маршрут без повторной генерации.
Как траектория генерации превращается в карту
Во время генерации ActMap перехватывает скрытое состояние каждого нового токена на каждом слое трансформера. Повторно запускать LLM не нужно: перехват идёт через обработчики внутри обычного прохода, а в замерах его накладные расходы не вышли за разброс между повторами.
Полученная траектория зависит от длины ответа, числа слоёв и ширины модели. ActMap сжимает её в тензор фиксированной формы 12 × 32 × 128. Соседние скрытые координаты объединяются усреднением, слои приводятся к общей шкале глубины, а последовательность токенов заменяют статистики: значения в разных частях ответа, финальное состояние, разброс, изменение со временем и величина активаций.
Одна карта занимает 96 КиБ. Её можно сохранить вместе с ответом и позднее заново оценить, не сохраняя полную траекторию активаций. Это полезно для аудита решений, но карта остаётся производной от внутренних данных модели и требует тех же правил доступа и хранения, что и исходный запрос.
После генерации карту читает небольшой обучаемый классификатор и выдаёт вероятность правильности. В основных опытах использовали Vision Transformer, однако многослойные перцептроны показали сопоставимый результат. Значит, основную пользу даёт структура карты, а не конкретная архитектура классификатора.
Метод проверяли на TriviaQA, NQ-Open, GSM8K и CNN/DailyMail с тремя моделями семейств Qwen, Llama и Mistral на 7–8 млрд параметров. Задачи включали короткие фактические ответы, математику без развёрнутой цепочки рассуждений и проверку фактов в резюме; генерация была жадной и на английском языке.
Где карта выигрывает у других сигналов
На TriviaQA с Qwen показатель AUROC у ActMap составил 0,887 против 0,847 у средней энтропии токенов и 0,772 у Semantic Entropy. AUROC показывает, насколько хорошо метод при разных порогах ставит ошибочные ответы ниже правильных.
На всех проверенных сочетаниях моделей и задач ActMap обошёл методы, которые смотрят только на вероятности токенов, внимание, один скрытый вектор или несколько сгенерированных ответов. С ACT-ViT, который обучается на плотных тензорах активаций, среднее качество ранжирования оказалось практически одинаковым. При этом ActMap хранит фиксированную карту и не привязывает размер представления к ширине конкретной модели.
Классификатор опирался прежде всего на совместную структуру глубины и скрытых координат. Если перед сжатием перемешать координаты, качество падает сильнее, чем при сведении всей карты к одному вектору последнего слоя. Закрытие отдельных областей карты также показало, что наиболее полезный сигнал сосредоточен в средних слоях, хотя это не доказывает, что модель хранит там отдельный признак истинности.
Статистики по времени оказались менее важны, чем ожидалось. Даже для длинных резюме каналы последнего токена почти повторили результат полной карты. В этой конструкции временные признаки прежде всего приводят ответы разной длины к общей форме, а не служат самостоятельным детектором ошибок.
Когда ActMap стоит закладывать в продукт
Подход меняет планы команды, если продукт работает на собственной LLM и должен выбирать между автоматическим ответом, дополнительной проверкой и отказом. В таком случае стоит заранее предусмотреть перехват скрытых состояний, хранение карт и отдельный классификатор. Для закрытого API без доступа к внутренним состояниям ActMap неприменим.
Классификатор нужно обучать на размеченных ответах из того же режима, где он будет работать. На одной связке задачи и модели около 3800 сбалансированных примеров уже позволили обойти проверенные методы без обучения, но перенос между датасетами, задачами, генераторами и масштабами модели часто давал результат около случайного. Замена модели или заметное изменение потока запросов поэтому требует новой проверки и, вероятно, переобучения.
Рабочий порог также нельзя переносить из сбалансированного эксперимента прямо в продукт. Если доля правильных ответов в реальном потоке отличается от обучающей, предсказанные вероятности теряют калибровку: заявленная уверенность перестаёт совпадать с фактической долей ошибок. ActMap лучше использовать как способ распределять бюджет проверки, а не как подтверждение истинности ответа.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



