目录
17.2.1 DQN及其变体:Double DQN, Dueling DQN
第17章 强化学习
17.1 强化学习基础
17.1.1 马尔可夫决策过程
强化学习的数学基础建立在马尔可夫决策过程(Markov Decision Process, MDP)之上。MDP提供了一个形式化的框架,用于描述智能体在随机环境中通过试错学习最优行为策略的问题。该框架由状态空间S 、动作空间A 、状态转移概率
目录
17.2.1 DQN及其变体:Double DQN, Dueling DQN
强化学习的数学基础建立在马尔可夫决策过程(Markov Decision Process, MDP)之上。MDP提供了一个形式化的框架,用于描述智能体在随机环境中通过试错学习最优行为策略的问题。该框架由状态空间S 、动作空间A 、状态转移概率
121
382
387
420
435
289

被折叠的 条评论
为什么被折叠?
