Журнал · Rit.work

Один балл аудита не описывает поведение RL-агента

Эксперимент с дискретными правилами показал: целостность журнала, покрытие состояний и совпадение решений нужно проверять отдельно, а объединение политик не создаёт новых навыков.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Совпадающие описания поведения агентов обучения с подкреплением (reinforcement learning, RL) не гарантируют, что агенты примут одинаковые решения. Хотя препринт Liu Hung Ming не прошёл рецензирование и все числа получил сам автор, его главный замер показателен: на новых состояниях политики выбирали одинаковое действие в 51,4% случаев — на уровне случайности. Значит, аудит продукта нельзя сводить к одному показателю покрытия правил.

Работа делит аудитируемость на шесть независимых свойств: целостность журнала, точное кодирование событий, покрытие правилами, совпадение поведения, качество объединённой политики и надёжность модели будущей награды. Система может точно воспроизвести записанный запуск и покрыть правилами большинство посещённых состояний, но это ещё не объясняет решения и не подтверждает, что другая политика действует так же.

Для сравнения политик использовали общий фиксированный преобразователь состояний в дискретные символы. Из журналов пассивно извлекали правила вида «условие — действие», связывали записи хешами и проверяли повторным запуском среды. Затем отдельный модуль выбирал наиболее уверенное правило из нескольких банков, а при отсутствии подходящего правила передавал управление резервной политике.

Такое объединение не создаёт навык: оно лишь выбирает среди уже записанных действий. На CartPole-v1 объединённая политика получила на 42,31 балла суммарной награды больше выбранного одиночного агента, но этот агент был выбран после обучения, а результат объединения остался примерно на 294 балла ниже лучшего участника. Поэтому сравнение показывает слабость способа выбора исходного агента, а не превосходство композиции.

Проверка охватила CartPole-v1 и Acrobot-v1, по восемь независимых запусков на задачу. На Acrobot-v1 правила сначала извлекали из случайно выбранных действий во время обучения, а применяли по действиям с максимальной вероятностью; из-за этого уверенный выбор правил уступил случайному. Когда правила перестроили в соответствии с режимом применения, порядок результатов изменился. Модель на основе оценки будущей награды дала ненадёжные результаты в обеих средах, поэтому эксперимент не доказывает превосходство правил над композициями через оценку ценности.

Для инженерного аудита вывод практический: журнал, покрытие, совпадение решений и качество композиции требуют отдельных приёмочных проверок. Если правила затем управляют системой, их нужно извлекать в том же режиме, в котором они будут применяться.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу