12、基于深度强化学习的延迟感知与节能方案

基于深度强化学习的延迟感知与节能方案

1. 深度强化学习方法概述

为解决联合优化问题,提出了一种深度强化学习(DRL)模型。将移动边缘计算(MEC)网络视为强化学习(RL)环境,DRL 模型作为学习代理与 MEC 网络交互并从经验中学习。由于 MEC 环境复杂,状态和转换对代理并非完全可观测,因此将 MEC 网络环境视为具有内部转移概率 $P(r, s′|s, a)$ 的马尔可夫决策过程(MDP),且该概率对 DRL 代理未知。进而提出一种无模型的 DRL 模型,在不了解内部转移的情况下从环境中学习,期望生成能最大化长期累积奖励的鲁棒策略。

2. 强化学习框架
  • 探索与利用的平衡 :RL 代理需在探索和利用之间取得平衡以从未知的 MEC 环境中学习。利用是根据 Q 值贪婪地探索搜索空间,即 $a = \argmax_{a′} Q(s, a′; w)$,其中 $w$ 是参数矩阵。探索则是让学习代理随机采取行动以获取关于 MEC 环境的新知识。采用 $\epsilon$-贪婪方法平衡探索和利用,模型以 $1 - \epsilon$ 的概率使用贪婪算法选择动作,以 $\epsilon$ 的概率随机选择动作。初始时,代理对 MEC 网络环境一无所知,在早期回合中采取更多随机动作探索环境,随着逐渐获取足够知识,开始利用所学知识生成最优策略,因此 $\epsilon$ 设计为随回合数递减。
  • 最优策略与动作价值 :RL 代理的目标是通过找到能最大化长期累积奖励的最优动作价值 $Q^ (s, a)$ 来学习最优策略 $\pi^ $。动作价值 $Q(s, a)$
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值