基于深度强化学习的延迟感知与节能方案
1. 深度强化学习方法概述
为解决联合优化问题,提出了一种深度强化学习(DRL)模型。将移动边缘计算(MEC)网络视为强化学习(RL)环境,DRL 模型作为学习代理与 MEC 网络交互并从经验中学习。由于 MEC 环境复杂,状态和转换对代理并非完全可观测,因此将 MEC 网络环境视为具有内部转移概率 $P(r, s′|s, a)$ 的马尔可夫决策过程(MDP),且该概率对 DRL 代理未知。进而提出一种无模型的 DRL 模型,在不了解内部转移的情况下从环境中学习,期望生成能最大化长期累积奖励的鲁棒策略。
2. 强化学习框架
- 探索与利用的平衡 :RL 代理需在探索和利用之间取得平衡以从未知的 MEC 环境中学习。利用是根据 Q 值贪婪地探索搜索空间,即 $a = \argmax_{a′} Q(s, a′; w)$,其中 $w$ 是参数矩阵。探索则是让学习代理随机采取行动以获取关于 MEC 环境的新知识。采用 $\epsilon$-贪婪方法平衡探索和利用,模型以 $1 - \epsilon$ 的概率使用贪婪算法选择动作,以 $\epsilon$ 的概率随机选择动作。初始时,代理对 MEC 网络环境一无所知,在早期回合中采取更多随机动作探索环境,随着逐渐获取足够知识,开始利用所学知识生成最优策略,因此 $\epsilon$ 设计为随回合数递减。
- 最优策略与动作价值 :RL 代理的目标是通过找到能最大化长期累积奖励的最优动作价值 $Q^ (s, a)$ 来学习最优策略 $\pi^ $。动作价值 $Q(s, a)$
超级会员免费看
订阅专栏 解锁全文

324

被折叠的 条评论
为什么被折叠?



