聊聊PyTorch强化学习实战——基于策略梯度法解决Pong环境(学习笔记)

今天翻到一篇不错的技术分享,看完之后自己也琢磨了一下,把思路梳理记录下来。

PyTorch强化学习实战——基于策略梯度法解决Pong环境

0. 前言

策略梯度法在 CartPole 等简单环境中表现出色,但面对 Pong 这类 Atari 游戏时却面临严峻挑战。与深度Q网络 (Deep Q-Network, DQN)仅需百万帧即可完美求解不同,原始策略梯度方法在 Pong 环境中难以收敛,且对超参数和初始化极其敏感。为提升性能,咱们引入三项关键改进:采用移动平均基线以减少梯度方差、使用多并行环境降低样本相关性、以及通过梯度裁剪增强训练稳定性。尽管经过大量超参数调优,本节实现的策略梯度方法仍未能达到理想效果,平均奖励仅维持在 -19.7 左右。这一失败案例恰好揭示了原始策略梯度方法在复杂任务中的局限性,为后续引入更先进的演员-评论家方法提供了重要动机。

1. 基于策略梯度法解决 Pong 环境

原始策略梯度方法在简单的 CartPole 环境中表现良好,但在更复杂的环境中效果却非常差。
对于相对简单的 Atari 游戏 PongDQN 能在100万帧内完全解决该游戏,并在仅 10 万帧时就展现出正向奖励动态,而策略梯度方法却未能收敛。由于策略梯度训练的不稳定性,寻找合适的超参数变得异常困难,且对初始化条件极其敏感。这并不意味策略梯度方法本身存在缺陷,只需对网络架构进行一些调整以获得更好的梯度基线,就能将策略梯度方法转变为高性能方法(异步优势演员-评论家方法)。当然,也可能超参数设置完全错误,或代码存在隐藏缺陷,亦或其他未预见的麻烦。但无论如何,失败的结果仍具有价值,至少能作为不良收敛动态的实证。

2. 实现策略梯度法解决Pong环境

pong_pg.py 代码中实现策略梯度方法解决 Pong 环境,与 CartPole 环境核心区别有三点:

1. 基线估计采用过去 100 万次状态转移的移动平均值,而非全部样本。为加速移动平均计算,创建了基于 deque 的缓冲区:

class MeanBuffer:
    def __init__(self, capacity: int):
        self.capacity = capacity
        self.deque = collections.deque(maxlen=capacity)
        self.sum = 0.0

    def add(self, val: float):
        if len(self.deque) == self.capacity:
            self.sum -= self.deque[0]
        self.deque.append(val)
        self.sum += val

    def mean(self) -> float:
        if not self.deque:
            return 0.0
        return self.sum / len(self.deque)

2. 使用多个并行环境。本节的第二项改进是采用多环境处理机制,将 Env 对象数组传递给 ExperienceSource 类。在多环境模式下,经验源会以轮询方式从各环境获取状态转移数据,从而提供相关性较低的训练样本
3. 通过梯度裁剪提升训练稳定性。与 CartPole 环境的最后一项区别是引入了梯度裁剪技术,该操作使用 torch.nn.utils 包中的 clip_grad_norm 函数实现。

最佳参数配置如下:

GAMMA = 0.99
LEARNING_RATE = 0.00010792
ENTROPY_BETA = 0.00010649
BATCH_SIZE = 128

REWARD_STEPS = 9
BASELINE_STEPS = 1000000
GRAD_L2_CLIP = 0.39215

ENV_COUNT = 32

3. 实验结果

尽管进行了改进,但效果并不理想。即使经过超参数调优(约 400 组参数组合测试),在 100 万次训练步骤后,最佳结果的平均奖励仍停留在 -19.7 左右。咱们也可以尝试不同超参数 (pong_pg_tune.py),但 Pong 游戏对原始策略梯度方法而言过于复杂。

相关链接

PyTorch强化学习实战(1)——强化学习(Reinforcement Learning,RL)详解
PyTorch强化学习实战(2)——强化学习环境库Gymnasium
PyTorch强化学习实战(3)——Gymnasium API扩展功能
PyTorch强化学习实战(4)——PyTorch基础
PyTorch强化学习实战(5)——PyTorch Ignite 事件驱动机制与实践
PyTorch强化学习实战(6)——交叉熵方法详解与实现
PyTorch强化学习实战(7)——表格学习与贝尔曼方程
PyTorch强化学习实战(8)——Q学习详解与实现
PyTorch强化学习实战(9)——深度Q学习
PyTorch强化学习实战(10)——强化学习高级组件
PyTorch强化学习实战(11)——N步DQN(N-step DQN)
PyTorch强化学习实战(12)——Double DQN(DDQN)
PyTorch强化学习实战(13)——噪声网络(NoisyNet-DQN)
PyTorch强化学习实战(14)——优先经验回放机制
PyTorch强化学习实战(15)——Dueling DQN
PyTorch强化学习实战(16)——Categorical DQN
PyTorch强化学习实战(17)——强化学习训练加速
PyTorch强化学习实战(18)——基于DQN处理股票交易麻烦
PyTorch强化学习实战(19)——策略梯度法


就写这么多吧,内容比较基础,适合入门回顾。有补充的地方欢迎留言一起完善。

评论 (0)

暂无评论