Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Совпадающие описания поведения агентов обучения с подкреплением (reinforcement learning, RL) не гарантируют, что агенты примут одинаковые решения. Хотя препринт Liu Hung Ming не прошёл рецензирование и все числа получил сам автор, его главный замер показателен: на новых состояниях политики выбирали одинаковое действие в 51,4% случаев — на уровне случайности. Значит, аудит продукта нельзя сводить к одному показателю покрытия правил.
Работа делит аудитируемость на шесть независимых свойств: целостность журнала, точное кодирование событий, покрытие правилами, совпадение поведения, качество объединённой политики и надёжность модели будущей награды. Система может точно воспроизвести записанный запуск и покрыть правилами большинство посещённых состояний, но это ещё не объясняет решения и не подтверждает, что другая политика действует так же.
Для сравнения политик использовали общий фиксированный преобразователь состояний в дискретные символы. Из журналов пассивно извлекали правила вида «условие — действие», связывали записи хешами и проверяли повторным запуском среды. Затем отдельный модуль выбирал наиболее уверенное правило из нескольких банков, а при отсутствии подходящего правила передавал управление резервной политике.
Такое объединение не создаёт навык: оно лишь выбирает среди уже записанных действий. На CartPole-v1 объединённая политика получила на 42,31 балла суммарной награды больше выбранного одиночного агента, но этот агент был выбран после обучения, а результат объединения остался примерно на 294 балла ниже лучшего участника. Поэтому сравнение показывает слабость способа выбора исходного агента, а не превосходство композиции.
Проверка охватила CartPole-v1 и Acrobot-v1, по восемь независимых запусков на задачу. На Acrobot-v1 правила сначала извлекали из случайно выбранных действий во время обучения, а применяли по действиям с максимальной вероятностью; из-за этого уверенный выбор правил уступил случайному. Когда правила перестроили в соответствии с режимом применения, порядок результатов изменился. Модель на основе оценки будущей награды дала ненадёжные результаты в обеих средах, поэтому эксперимент не доказывает превосходство правил над композициями через оценку ценности.
Для инженерного аудита вывод практический: журнал, покрытие, совпадение решений и качество композиции требуют отдельных приёмочных проверок. Если правила затем управляют системой, их нужно извлекать в том же режиме, в котором они будут применяться.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



