Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Vijay Erramilli предложил ObserverBench — набор задач для проверки внутренних оценщиков, управляющих вмешательствами в модель; работа опубликована как препринт, не проходивший рецензирования. В подтверждающем опыте на GPT-2 обучение под потери от действия снизило их на 18,5% относительно оценщика среднего эффекта с теми же входными признаками. Это важно командам, которые используют внутренние сигналы LLM для управления генерацией, удаления компонентов или распределения проверок безопасности.
Что сделали
Авторы называют наблюдателем оценщик, который читает доступные ему данные о модели и прогнозирует внутреннее состояние, результат вмешательства или риск запроса. Контроллер превращает эту оценку в действие: выбирает направление изменения активаций, отключаемый компонент либо запрос, который отправится на дополнительную проверку.
ObserverBench разделяет качество оценки и качество принятого на её основе решения. Для каждой задачи фиксируются модель, доступная наблюдателю информация, допустимые действия, правило их выбора, отложенные тестовые случаи и функция потерь. Благодаря этому снижение потерь нельзя объяснить тем, что один участник использовал более гибкий контроллер, больший бюджет или более простые примеры.
В работе предусмотрены три режима. В замкнутом управлении оценщик участвует в последовательности вмешательств, поэтому ошибка измеряется по всей траектории. В прогнозировании эффектов он оценивает последствия нескольких вмешательств, после чего контроллер выбирает одно из них. В сортировке рисков наблюдатель распределяет ограниченный бюджет проверок, а итог зависит не только от числа найденных нарушений, но и от стоимости пропущенных случаев.
Отдельно задаётся граница доступной и доверенной информации: какие активации, входные данные или выходные вероятности разрешено читать и могут ли эти измерения быть изменены или скрыты. Сравнивать наблюдатели предлагается только внутри одного такого контракта, без общего рейтинга для несовместимых задач.
Что показали
На задачах вмешательства в схемы GPT-2-small и Qwen2.5-7B модели с попарными признаками точнее предсказывали эффекты на новых примерах, но не всегда выбирали действие с меньшими потерями. Когда оценщик обучали непосредственно прогнозировать потери каждого действия, в совокупном опыте на Qwen потери снизились на 8,9% относительно оценщика среднего эффекта. Это различие возникает потому, что средняя ошибка прогноза одинаково учитывает все случаи, тогда как контроллеру особенно важны ошибки, меняющие выбор действия.
В опыте с замкнутым управлением добавление признака взаимодействия снизило накопленную ошибку на 29% там, где целевая зависимость действительно содержала такое взаимодействие. Для аддитивной зависимости авторы не получили надёжного преимущества. Результат относится к совместно выбранным оценщику и направлению вмешательства, а не доказывает превосходство оценщика отдельно от контроллера.
В задаче безопасности наблюдатель с AUROC 1,000 — то есть с идеальным разделением нарушающих и безопасных случаев по рангу — всё равно нерационально расходовал фиксированный бюджет проверок, если не учитывал последствия конкретных нарушений. В опытах на APPS метрика ранжирования могла располагать мониторы не в том порядке, который получался по фактическим потерям при применении политики. Лучший источник сигнала также менялся между моделями, а разреженные считыватели на основе SAE уступали сопоставленным плотным оценщикам на представленных панелях.
Ограничения
Точный анализ замкнутого управления предполагает линейные считыватели, одно направление вмешательства, пропорциональный контроллер и отсутствие ограничения величины действия. Нелинейную проверку провели на 12 небольших Transformer, обученных на искусственных данных с заранее известными бинарными признаками. Она не показывает, сохранится ли результат при управлении крупной моделью на уровне отдельных токенов.
Опыты с GPT-2 и Qwen используют выбранные наборы голов внимания, фиксированные отключения и узкие распределения запросов. Проверки безопасности охватывают две семьи моделей и три контрольные точки на одной задаче с сохранёнными закладками APPS. Они выполняются офлайн, не включают вредоносное исполнение, обман или атакующего, который адаптируется к монитору.
Часть сравнений SAE проведена при несовпадении плотности активаций или контрольных точек базовой и дообученной модели, что не позволяет считать их чистой проверкой разреженности. Авторы также не сравнивают ObserverBench с широким набором воспроизведённых методов из литературы и прямо характеризуют выпуск как рабочий набор интерфейсов, а не как готовую общую экосистему задач.
Что это значит
Работа не даёт оснований менять выбранную базовую модель или отказываться от механистической интерпретируемости. Она меняет план оценки систем, где интерпретация уже управляет действием. Точность внутреннего прогноза, полнота обнаружения нарушений или компактность считывателя не должны быть единственным критерием допуска в эксплуатацию.
Для такого проекта до обучения наблюдателя стоит зафиксировать доступную ему информацию, набор действий, контроллер, бюджет и потери от ошибок. Затем нужно отдельно измерять качество прогноза и результат выбранных действий на отложенных случаях. Если система распределяет проверки безопасности, функция потерь должна учитывать последствия пропуска, а не только правильность классификации.
Внутренний сигнал также следует сравнивать с более простыми источниками: входным текстом, выходными вероятностями модели и плотным считывателем того же слоя. Если они приводят к тому же или лучшему решению, дополнительный доступ к активациям не получает практического обоснования в рамках этой задачи.
ObserverBench при этом оценивает один компонент фиксированной политики. Даже низкие потери наблюдателя не подтверждают безопасность всей системы против намеренного обхода, подмены измерений или последовательной атаки. Для продуктового плана это означает разделение двух этапов: сначала проверка полезности внутреннего оценщика при неизменном контроллере, затем отдельное испытание полного протокола безопасности.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



