Журнал · Rit.work

PreferenceEKF оценивает неопределённость модели вознаграждения в подпространстве

Авторы PreferenceEKF предлагают обучать модель вознаграждения на выбранных сравнениях, отслеживая неопределённость параметров в подпространстве нейросети.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Yutai Zhou и Erdem Bıyık из University of Southern California разработали PreferenceEKF для активного обучения моделей вознаграждения по предпочтениям; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, метод не уступил или превзошёл четыре подхода байесовского глубокого обучения по эффективности использования сравнений и качеству оценки неопределённости. Результат важен командам, которые обучают агентов по обратной связи и хотят сократить число запросов к разметчикам без обучения ансамбля независимых моделей.

Что сделали

При активном обучении система не размечает случайные пары траекторий, а выбирает сравнения, которые должны дать больше информации о предпочтениях. Для такого выбора нужна оценка неопределённости модели: она показывает, в каких случаях модель вознаграждения хуже всего понимает возможный ответ.

PreferenceEKF представляет обучение как последовательную байесовскую фильтрацию. Параметры нейросети считаются скрытым состоянием, которое обновляется после каждого нового сравнения с помощью расширенного фильтра Калмана. Чтобы не хранить ковариационную матрицу для всей сети, авторы выполняют вывод в низкоразмерном подпространстве параметров. Его строят по промежуточным состояниям предварительного обучения, а полученные образцы проецируют обратно в полное пространство сети.

Это позволяет рассчитывать ожидаемый прирост информации — критерий выбора следующего сравнения — без повторного обучения нескольких моделей. На задачах D4RL авторы измерили сопоставимое или более высокое качество моделирования предпочтений, лучшую калибровку неопределённости и более благоприятное масштабирование времени работы относительно числа параметров и образцов модели.

Что это значит

PreferenceEKF предлагает компромисс между одиночной точечной моделью, которая не описывает неопределённость, и ансамблем, требующим обучать несколько сетей. Для продукта потенциальная выгода находится не в ускорении ответа готовой модели, а в цикле сбора обратной связи: система может выбирать более информативные задания для разметчиков и обновляться после каждого ответа.

Ограничения. Проверка охватывает задачи непрерывного управления: 12 задач D4RL и три задачи V-D4RL, причём для изображений использованы заранее обученные представления, а не исходные пиксели. Основные эксперименты опираются на имитированного разметчика, хотя отдельно приведены испытания с собранными у людей предпочтениями. Работа не показывает применимость к моделям вознаграждения масштаба фундаментальных моделей. Кроме того, расширенный фильтр Калмана поддерживает одномодальное гауссово распределение, поэтому сравнение не отвечает на случай нескольких групп разметчиков с различающимися предпочтениями.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу