2025 IEEE TCDS,基于协同优化算法的多不连通区域无人机覆盖路径规划


1.摘要

当UAV需要巡检多个彼此隔离、形状不规则的目标区域时,既要在每个区域内完成全覆盖,又要决定区域访问顺序和进入、离开位置。该问题可视为旅行商问题与覆盖路径规划耦合而成的TSP-CPP,具有NP-hard特征。论文将其拆分为两级子问题:先为每个凸多边形区域生成往返式覆盖路径,再联合优化不同区域的访问顺序及区域入口。为此,论文提出两种协同优化方法:协同进化遗传算法(CGA)以定制浮点编码同时进化区域间访问与区域内入口选择;强化学习(RL)方法把区域表示为四个候选入口点,借助图指针网络(GPN)端到端输出访问决策。仿真显示,CGA解质量最高但迭代耗时较长;RL可在很短时间内获得接近CGA的解,优于贪心基线,适合时效性任务。

2.问题背景与建模

覆盖路径规划要求UAV在传感器覆盖范围内访问任务区域的所有位置,常用于安防巡检、设施检查、地形测绘和矿产勘测。针对单区域,矩形、凸多边形、凹多边形和不规则区域均已有成熟建模方式,往返式路径(back-and-forth path,BFP)因利于图像拼接和三维重建而常被采用。

论文考虑一架UAV从基地 A 0 A_0 A0出发,覆盖 N N N个不连通凸多边形区域 { A 1 , … , A N } \{A_1,\ldots,A_N\} {A1,,AN}后回到基地。UAV保持恒定高度和速度,电量足以完成任务。总代价由区域间飞行和区域内覆盖两部分组成:

J = J i n t e r + J i n t r a . J=J_{\mathrm{inter}}+J_{\mathrm{intra}}. J=Jinter+Jintra.

J i n t e r J_{\mathrm{inter}} Jinter取决于区域访问顺序及各区域的入口、出口, J i n t r a J_{\mathrm{intra}} Jintra取决于区域内覆盖路线。

3.凸多边形覆盖与TSP-CPP形式化

每个任务区域 A i A_i Ai以逆时针排列的凸多边形顶点表示。论文采用BFP并使用已有方法寻找转弯数最少的扫描方向。对同一凸多边形,扫描路径存在4条等价的最优方向变体:它们经过相同的航路点集合 W i W_i Wi,但访问顺序不同。令 P k i P_k^i Pki为第 k k k条覆盖路径, w j i w_j^i wji为第 j j j个航路点,其区域内飞行代价为

C ( P k i ) = ∑ j = 1 n − 1 ∥ w j i − w j + 1 i ∥ 2 . C(P_k^i)=\sum_{j=1}^{n-1}\left\|w_j^i-w_{j+1}^i\right\|_2. C(Pki)=j=1n1 wjiwj+1i 2.

二元变量 y k i y_k^i yki表示是否选择 P k i P_k^i Pki,每个区域恰好选择一种覆盖方向,因此

J i n t r a = ∑ i = 1 N ∑ k = 1 4 y k i C ( P k i ) , ∑ k = 1 4 y k i = 1. J_{\mathrm{intra}}=\sum_{i=1}^{N}\sum_{k=1}^{4}y_k^i C(P_k^i),\qquad \sum_{k=1}^{4}y_k^i=1. Jintra=i=1Nk=14ykiC(Pki),k=14yki=1.

四条路径的首航路点构成4个候选入口 e k i e_k^i eki。由于每个入口都一一对应确定的覆盖路径和出口,定义映射 G ( e k i ) G(e_k^i) G(eki)将入口映射为该路径的出口。设 x i j = 1 x_{ij}=1 xij=1表示UAV从区域 A i A_i Ai转移到 A j A_j Aj,则跨区域代价为

J i n t e r = ∑ i = 0 N ∑ j = 0 N d i j x i j , J_{\mathrm{inter}}=\sum_{i=0}^{N}\sum_{j=0}^{N}d_{ij}x_{ij}, Jinter=i=0Nj=0Ndijxij,

d i j = ∑ p = 1 4 ∑ q = 1 4 y p i y q j ∥ G ( e p i ) − e q j ∥ 2 . d_{ij}=\sum_{p=1}^{4}\sum_{q=1}^{4}y_p^iy_q^j\left\|G(e_p^i)-e_q^j\right\|_2. dij=p=14q=14ypiyqj G(epi)eqj 2.

4.协同进化遗传算法

CGA将TSP-CPP分成两个协同进化分量:区域间分量InterAC表示区域排列,区域内分量IntraAC表示每个区域的入口编号。传统分开编码会拉长染色体且削弱两部分的协同;将两者写入同一浮点基因。

交叉在第一亲本上选择若干交叉位置,保留其余基因,再按第二亲本的顺序继承具有相同整数部分的基因及其小数部分。变异随机交换两个基因的整数部分以维持区域排列合法性;小数部分则随机重生,以增加入口选择的多样性。每个个体按总飞行距离 D i D_i Di计算适应度:

F ( p i ) = exp ⁡ ( C D i ) , F(p_i)=\exp\left(\frac{C}{D_i}\right), F(pi)=exp(DiC),

其中, C > 0 C>0 C>0为尺度因子,路径越短则适应度越高。种群采用按适应度概率的选择机制;若最优适应度连续 N max ⁡ N_{\max} Nmax次迭代不再提升,则认为种群稳定并停止进化。

5.基于强化学习的端到端规划

RL方法将经典TSP中城市扩展为带4个候选入口的区域。区域 A i A_i Ai被编码为

r i = [ e 1 i , e 2 i , e 3 i , e 4 i ] ∈ R 8 , r_i=[e_1^i,e_2^i,e_3^i,e_4^i]\in\mathbb{R}^8, ri=[e1i,e2i,e3i,e4i]R8,

基地坐标复制4次形成 r 0 r_0 r0以统一输入维度。当前状态还包含刚完成区域的入口和出口 s t = [ e Γ ( t ) τ t , G ( e Γ ( t ) τ t ) ] s_t=[e_{\Gamma(t)}^{\tau_t},G(e_{\Gamma(t)}^{\tau_t})] st=[eΓ(t)τt,G(eΓ(t)τt)]。模型将相对当前位置的区域特征嵌入高维向量,由GNN提取所有候选区域的图上下文;LSTM编码当前决策状态;注意力解码器输出指针分数:

u t = V T tanh ⁡ ( W r c + W q q ) , u_t=V^T\tanh(W_rc+W_qq), ut=VTtanh(Wrc+Wqq),

其中, q q q来自LSTM隐状态, c c c为GNN上下文。已访问区域通过mask赋为 − ∞ -\infty ,避免重复访问;softmax得到下一入口的策略:

π θ ( a t ∣ s t ) = softmax ⁡ ( u t ) . \pi_\theta(a_t\mid s_t)=\operatorname{softmax}(u_t). πθ(atst)=softmax(ut).

输出入口决定相应出口,因而整条跨区域路线的代价或奖励

R = ∑ t = 0 N ∥ G ( e Γ ( t ) τ t ) − e Γ ( t + 1 ) τ t + 1 ∥ 2 . R=\sum_{t=0}^{N}\left\|G(e_{\Gamma(t)}^{\tau_t})-e_{\Gamma(t+1)}^{\tau_{t+1}}\right\|_2. R=t=0N G(eΓ(t)τt)eΓ(t+1)τt+1 2.

6.实验结果

对比算法包括贪心(GE)、CGA和RL。贪心法每一步选择距当前位置最近的下一入口,只保证局部最优;CGA同步优化区域顺序与入口;RL使用预训练GPN模型端到端决策。指标为跨区域总飞行距离和单次运行时间。

在1000个测试实例上,区域数 N = 4 N=4 N=4时,GE、CGA、RL的平均跨区域距离分别为324.6256、294.6502和299.9328;CGA输出最优解的频率为100.0%,RL为45.4%,GE为8.2%。 N = 6 N=6 N=6时,三者平均距离为377.0618、321.7032和325.9156,最优解频率为2.3%、97.3%和45.7%。 N = 8 N=8 N=8时,平均距离分别为420.3942、346.5192和353.3004,最优解频率为1.0%、88.4%和34.0%。随着区域数增加,贪心法的劣势迅速扩大,CGA和RL仍保持较高质量,其中CGA更优,RL与其差距较小。

论文面向多个不连通凸多边形的单UAV覆盖任务,提出先生成区域内BFP、再联合选择区域访问顺序与入口点的两步TSP-CPP建模。CGA利用不增加染色体长度的浮点共编码,让区域间与区域内决策协同进化,适合获得较高质量解;RL将每个区域的4个入口表示输入GPN,在离线训练后快速输出近似解,适合紧急规划。

7.参考文献

Lyu Y, Wang S, Hu T, et al. UAV coverage path planning of multiple disconnected regions based on cooperative optimization algorithms[J]. IEEE Transactions on Cognitive and Developmental Systems, 2024, 17(2): 259-270.

8.算法辅导·应用定制·读者交流

xx

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

小O的算法实验室

谢谢大佬的肯定!

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值