1.摘要
当UAV需要巡检多个彼此隔离、形状不规则的目标区域时,既要在每个区域内完成全覆盖,又要决定区域访问顺序和进入、离开位置。该问题可视为旅行商问题与覆盖路径规划耦合而成的TSP-CPP,具有NP-hard特征。论文将其拆分为两级子问题:先为每个凸多边形区域生成往返式覆盖路径,再联合优化不同区域的访问顺序及区域入口。为此,论文提出两种协同优化方法:协同进化遗传算法(CGA)以定制浮点编码同时进化区域间访问与区域内入口选择;强化学习(RL)方法把区域表示为四个候选入口点,借助图指针网络(GPN)端到端输出访问决策。仿真显示,CGA解质量最高但迭代耗时较长;RL可在很短时间内获得接近CGA的解,优于贪心基线,适合时效性任务。
2.问题背景与建模

覆盖路径规划要求UAV在传感器覆盖范围内访问任务区域的所有位置,常用于安防巡检、设施检查、地形测绘和矿产勘测。针对单区域,矩形、凸多边形、凹多边形和不规则区域均已有成熟建模方式,往返式路径(back-and-forth path,BFP)因利于图像拼接和三维重建而常被采用。
论文考虑一架UAV从基地 A 0 A_0 A0出发,覆盖 N N N个不连通凸多边形区域 { A 1 , … , A N } \{A_1,\ldots,A_N\} {A1,…,AN}后回到基地。UAV保持恒定高度和速度,电量足以完成任务。总代价由区域间飞行和区域内覆盖两部分组成:
J = J i n t e r + J i n t r a . J=J_{\mathrm{inter}}+J_{\mathrm{intra}}. J=Jinter+Jintra.
J i n t e r J_{\mathrm{inter}} Jinter取决于区域访问顺序及各区域的入口、出口, J i n t r a J_{\mathrm{intra}} Jintra取决于区域内覆盖路线。
3.凸多边形覆盖与TSP-CPP形式化

每个任务区域 A i A_i Ai以逆时针排列的凸多边形顶点表示。论文采用BFP并使用已有方法寻找转弯数最少的扫描方向。对同一凸多边形,扫描路径存在4条等价的最优方向变体:它们经过相同的航路点集合 W i W_i Wi,但访问顺序不同。令 P k i P_k^i Pki为第 k k k条覆盖路径, w j i w_j^i wji为第 j j j个航路点,其区域内飞行代价为
C ( P k i ) = ∑ j = 1 n − 1 ∥ w j i − w j + 1 i ∥ 2 . C(P_k^i)=\sum_{j=1}^{n-1}\left\|w_j^i-w_{j+1}^i\right\|_2. C(Pki)=j=1∑n−1 wji−wj+1i 2.
二元变量 y k i y_k^i yki表示是否选择 P k i P_k^i Pki,每个区域恰好选择一种覆盖方向,因此
J i n t r a = ∑ i = 1 N ∑ k = 1 4 y k i C ( P k i ) , ∑ k = 1 4 y k i = 1. J_{\mathrm{intra}}=\sum_{i=1}^{N}\sum_{k=1}^{4}y_k^i C(P_k^i),\qquad \sum_{k=1}^{4}y_k^i=1. Jintra=i=1∑Nk=1∑4ykiC(Pki),k=1∑4yki=1.
四条路径的首航路点构成4个候选入口 e k i e_k^i eki。由于每个入口都一一对应确定的覆盖路径和出口,定义映射 G ( e k i ) G(e_k^i) G(eki)将入口映射为该路径的出口。设 x i j = 1 x_{ij}=1 xij=1表示UAV从区域 A i A_i Ai转移到 A j A_j Aj,则跨区域代价为
J i n t e r = ∑ i = 0 N ∑ j = 0 N d i j x i j , J_{\mathrm{inter}}=\sum_{i=0}^{N}\sum_{j=0}^{N}d_{ij}x_{ij}, Jinter=i=0∑Nj=0∑Ndijxij,
d i j = ∑ p = 1 4 ∑ q = 1 4 y p i y q j ∥ G ( e p i ) − e q j ∥ 2 . d_{ij}=\sum_{p=1}^{4}\sum_{q=1}^{4}y_p^iy_q^j\left\|G(e_p^i)-e_q^j\right\|_2. dij=p=1∑4q=1∑4ypiyqj G(epi)−eqj 2.
4.协同进化遗传算法
CGA将TSP-CPP分成两个协同进化分量:区域间分量InterAC表示区域排列,区域内分量IntraAC表示每个区域的入口编号。传统分开编码会拉长染色体且削弱两部分的协同;将两者写入同一浮点基因。
交叉在第一亲本上选择若干交叉位置,保留其余基因,再按第二亲本的顺序继承具有相同整数部分的基因及其小数部分。变异随机交换两个基因的整数部分以维持区域排列合法性;小数部分则随机重生,以增加入口选择的多样性。每个个体按总飞行距离 D i D_i Di计算适应度:
F ( p i ) = exp ( C D i ) , F(p_i)=\exp\left(\frac{C}{D_i}\right), F(pi)=exp(DiC),
其中, C > 0 C>0 C>0为尺度因子,路径越短则适应度越高。种群采用按适应度概率的选择机制;若最优适应度连续 N max N_{\max} Nmax次迭代不再提升,则认为种群稳定并停止进化。
5.基于强化学习的端到端规划
RL方法将经典TSP中城市扩展为带4个候选入口的区域。区域 A i A_i Ai被编码为
r i = [ e 1 i , e 2 i , e 3 i , e 4 i ] ∈ R 8 , r_i=[e_1^i,e_2^i,e_3^i,e_4^i]\in\mathbb{R}^8, ri=[e1i,e2i,e3i,e4i]∈R8,
基地坐标复制4次形成 r 0 r_0 r0以统一输入维度。当前状态还包含刚完成区域的入口和出口 s t = [ e Γ ( t ) τ t , G ( e Γ ( t ) τ t ) ] s_t=[e_{\Gamma(t)}^{\tau_t},G(e_{\Gamma(t)}^{\tau_t})] st=[eΓ(t)τt,G(eΓ(t)τt)]。模型将相对当前位置的区域特征嵌入高维向量,由GNN提取所有候选区域的图上下文;LSTM编码当前决策状态;注意力解码器输出指针分数:
u t = V T tanh ( W r c + W q q ) , u_t=V^T\tanh(W_rc+W_qq), ut=VTtanh(Wrc+Wqq),
其中, q q q来自LSTM隐状态, c c c为GNN上下文。已访问区域通过mask赋为 − ∞ -\infty −∞,避免重复访问;softmax得到下一入口的策略:
π θ ( a t ∣ s t ) = softmax ( u t ) . \pi_\theta(a_t\mid s_t)=\operatorname{softmax}(u_t). πθ(at∣st)=softmax(ut).
输出入口决定相应出口,因而整条跨区域路线的代价或奖励
R = ∑ t = 0 N ∥ G ( e Γ ( t ) τ t ) − e Γ ( t + 1 ) τ t + 1 ∥ 2 . R=\sum_{t=0}^{N}\left\|G(e_{\Gamma(t)}^{\tau_t})-e_{\Gamma(t+1)}^{\tau_{t+1}}\right\|_2. R=t=0∑N G(eΓ(t)τt)−eΓ(t+1)τt+1 2.
6.实验结果
对比算法包括贪心(GE)、CGA和RL。贪心法每一步选择距当前位置最近的下一入口,只保证局部最优;CGA同步优化区域顺序与入口;RL使用预训练GPN模型端到端决策。指标为跨区域总飞行距离和单次运行时间。

在1000个测试实例上,区域数 N = 4 N=4 N=4时,GE、CGA、RL的平均跨区域距离分别为324.6256、294.6502和299.9328;CGA输出最优解的频率为100.0%,RL为45.4%,GE为8.2%。 N = 6 N=6 N=6时,三者平均距离为377.0618、321.7032和325.9156,最优解频率为2.3%、97.3%和45.7%。 N = 8 N=8 N=8时,平均距离分别为420.3942、346.5192和353.3004,最优解频率为1.0%、88.4%和34.0%。随着区域数增加,贪心法的劣势迅速扩大,CGA和RL仍保持较高质量,其中CGA更优,RL与其差距较小。
论文面向多个不连通凸多边形的单UAV覆盖任务,提出先生成区域内BFP、再联合选择区域访问顺序与入口点的两步TSP-CPP建模。CGA利用不增加染色体长度的浮点共编码,让区域间与区域内决策协同进化,适合获得较高质量解;RL将每个区域的4个入口表示输入GPN,在离线训练后快速输出近似解,适合紧急规划。
7.参考文献
Lyu Y, Wang S, Hu T, et al. UAV coverage path planning of multiple disconnected regions based on cooperative optimization algorithms[J]. IEEE Transactions on Cognitive and Developmental Systems, 2024, 17(2): 259-270.
8.算法辅导·应用定制·读者交流
xx

1611

被折叠的 条评论
为什么被折叠?



