强化学习面临的挑战:深入剖析与应对策略
1. 灾难性干扰
强化学习与监督学习不同,它具有动态学习过程,可看作是在数据集不断更新的情况下追逐一个移动目标。例如,基于当前策略 $\pi$ 估计的在线策略价值函数 $V^{\pi}(s)$ 和动作价值函数 $Q^{\pi}(s, a)$ ,由于策略在学习过程中不断更新,导致价值函数的估计也是动态的。即便采用离策略重放缓冲区能缓解训练数据集相对不稳定的问题,但缓冲区中的样本仍会随智能体的探索过程而改变。
当基于神经网络的深度学习方法学习策略或价值函数时,可能会出现灾难性干扰或灾难性遗忘问题。新数据往往会使训练好的网络发生较大变化以适应它,却会遗忘之前训练过程中学到的有用信息,这是在强化学习方法中使用神经网络作为近似器的一个局限。
自然且类似人类的学习过程实际上是在线策略学习,人类每天实时学习新事物,而非总是从记忆中学习。然而,在线策略强化学习仍难以提高学习效率,并需防止灾难性干扰问题。基于信任区域的算法(如 TRPO 和 PPO)在学习过程中对更新策略的潜在范围进行约束,以确保学习性能稳定但相对缓慢地提升。对于在线策略学习,数据通常是相关数据,这在很大程度上导致了灾难性干扰。因此,离策略学习方法采用经验重放缓冲区来缓解此问题,使旧数据在学习过程中能在一定程度上保留。像优先经验重放和后见之明经验重放等技术,可根据数据的重要性或目标以复杂的方式利用重放缓冲区中存储的数据。
在多阶段学习过程中也会发生灾难性遗忘。例如,在从模拟到现实的策略转移过程中,策略通常需要先在模拟环境中预训练,然后用现实世界的数据进行微调。但在实践中,这两个过程的损失函数可能不同,且可能并不总是与整体强化学习目标一致。这种多阶段训练过程中损失函数的不匹
超级会员免费看
订阅专栏 解锁全文

68

被折叠的 条评论
为什么被折叠?



