有效
一种多无人机巡检轨迹和移动储能端调度巡检方法及系统
叶宇轩、廖荣涛、胡钰林、周正、罗弦、王逸兮、李磊、宁昊、王晟玮、张剑、张玉洁、郭岳、高云飞
国网湖北省电力有限公司信息通信公司
叶
叶宇轩 专利 77
国家电网有限公司计算模型系统数字信息传输生物模型计算
廖
廖荣涛 专利 191
湖北华中电力科技开发有限责任公司网络管理网络服务协议模式识别
胡
胡钰林 专利 130
武汉大学电通信技术电学计算技术
周
周正 专利 515
武汉大学热喷涂井下工具操作井封隔
罗
罗弦 专利 153
湖北思极科技有限公司网络管理模式识别计算模型系统
王
王逸兮 专利 191
国家电网有限公司网络管理网络服务协议模式识别
李
李磊 专利 36
武汉大学计算技术物理仪器电子数据处理
宁
宁昊 专利 64
国网湖北省电力有限公司信息通信公司计算模型系统生物模型计算计算技术
王
王晟玮 专利 98
国网湖北省电力有限公司信息通信公司网络管理计算模型系统计算技术
张
张剑 专利 63
国网湖北省电力有限公司信息通信公司计算模型系统计算技术电学
张
张玉洁 专利 46
武汉大学计算技术电学物理仪器
郭
郭岳 专利 125
国网湖北省电力有限公司模式识别生物模型计算计算模型系统
高
高云飞 专利 16
武汉大学物理量控制控制调节自动驾驶控制
摘要
本发明提出一种多无人机巡检轨迹和移动储能端调度巡检方法及系统,该方法先获取各无人机巡检点的位置信息,然后根据巡检点的分布以及无人机数量分配各无人机的巡检点,最后基于各无人机的巡检任务,采用基于多头自注意力机制的DDQN算法优化各无人机巡检轨迹,并优化确定移动储能端的充电调度策略。本发明不仅提升了无人机的巡检效率,减少了总的巡检时间,而且提升了无人机在巡检过程中的安全性。
1.一种多无人机巡检轨迹和移动储能端调度巡检方法,其特征在于,所述方法包括:S1、获取各无人机巡检点的位置信息;S2、根据巡检点的分布以及无人机数量分配各无人机的巡检点;S3、基于各无人机的巡检点,采用基于多头自注意力机制的DDQN算法优化各无人机巡检轨迹,并优化确定移动储能端的充电调度策略。
2.根据权利要求1所述的一种多无人机巡检轨迹和移动储能端调度巡检方法,其特征在于,所述S3包括:S31、基于贪婪算法确定无人机的最优巡检点;S32、在当前时隙根据ε-greedy策略选择无人机的飞行速度v n ,并根据以下公式计算当前时隙的奖励r n :上式中,r a 为无人机飞去禁飞区的惩罚,d o,n 为无人机当前位置与巡检点的距离,d o,n+1 为无人机下一时隙位置与巡检点的距离,η为减少无人机巡检时隙的常数,且r a 、η均为负的常数;S33、将转移的结果(q n ,v n ,r n ,q n+1 )保存到经验池中,其中,q n 、q n+1 分别为无人机在当前时隙、下一时隙的位置;S34、随机从经验池中选择N 1 步样本,并使用梯度下降法减小神经网络的损失,从而优化无人机的巡检轨迹,获得更大的奖励,最终得到各无人机的最优巡检轨迹,其中,损失函数loss为:上式中,λ为折扣因子,Q(q n ,v n |θ)为当前dueling网络中无人机在位置q n 采取动作v n 的Q值, 为目标dueling网络中无人机在位置q n+1 采取动作 的Q值,θ、θ * 为影响神经网络模型参数的因子;所述dueling网络中引入了多头自注意力机制对状态价值函数和优势函数增强,增强后的Q函数为:V(q)=f V (h att (q))A(q,v)=f A (h att (q),v)Q i =W Q h(q)K j =W K h(q)V j =W V h(q)上式中,V(q)、A(q,v)分别为状态价值函数和优势函数,q、v分别为无人机所在的位置和采取的动作,B为可选择动作的个数,f V 用于从注意力增强的状态特征h att (q)计算状态价值V(q),h att (q)为注意力增强后的状态特征表示,f A 用于从注意力增强后的状态特征计算优势函数A(q,v),v i,j 为注意力权重,V j 为值向量,Q i 为查询向量, 为键向量的转置,i为查询向量的索引,j为键向量和值向量的索引,d k 为键向量的维度,W Q 为将h(q)映射到查询向量空间的线性变换矩阵,W K 为将h(q)映射到键向量空间的线性变换矩阵,W V 为将h(q)映射到值向量空间的线性变化矩阵,h(q)为特征向量;S35、判断无人机当前电池能量是否小于设定的阈值,若小于,则移动储能端根据充电调度策略对无人机进行充电;若不小于,则进入S36;S36、判断无人机是否完成该巡检点的巡检任务,若未完成,则返回S32;若完成,则进入S37;S37、判断无人机是否完成所有巡检点的巡检任务,若未完成,则返回S31;若完成,则进入S38;S38、判断是否达到最大迭代次数,若未达到,则返回S31进行下一个无人机的巡检轨迹优化。
3.根据权利要求2所述的一种多无人机巡检轨迹和移动储能端调度巡检方法,其特征在于,所述S31包括:S311、无人机对其分配的所有巡检点进行编号;S312、计算无人机当前位置与每个未完成巡检点的距离,删除已完成巡检的点,并将剩余巡检点按距离从大到小进行排序;S313、判断距离最小的巡检点是否已完成巡检,若已完成,则返回S312进行下一次循环计算;若未完成,则输出该巡检点的编号作为下一目标。
4.根据权利要求2所述的一种多无人机巡检轨迹和移动储能端调度巡检方法,其特征在于,所述移动储能端的充电调度策略采用双向启发A*算法优化确定,该算法的流程包括:S351、初始化open_list和closed_list,将移动储能端的起点w s 加入open_list;S352、同时进行正向搜索和反向搜索,其中,正向搜索从起点开始,寻找通向目标的路径,反向搜索则从目标开始,寻找通向起点的路径,计算open_list中各节点的F值,选择F值最小的节点作为当前节点w c ,其中,各节点的F值由以下公式计算得到:F=f forward (b)+f backward (b)f forward (b)=g start (b)+h goal (b)f backward (b)=g goal (b)+h start (b)上式中,f forward (b)、f backward (b)分别为正向、反向搜索的预期总路径代价,g start (b)为从起点w s 到当前节点b的实际路径代价,h goal (b)为从当前节点b到目标节点w g 的预估代价,g goal (b)为从目标到当前节点b的反向搜索总路径代价,h start (b)为从当前节点b回到起点w s 的启发值;S353、将当前节点w c 从open_list移至closed_list中;S354、判断当前节点w c 的邻居节点是否为新节点或发现更短路径,若是,则将其加入open_list中;S355、判断当前节点w c 是否为目标节点w g 或open_list为空,若是,则输出移动储能端的最优路径,即移动储能端的充电调度方案;若不是,则返回S352。
5.根据权利要求1或2所述的一种多无人机巡检轨迹和移动储能端调度巡检方法,其特征在于,所述S2采用基于密度感知的K-Means++算法分配各无人机的巡检点,该算法的流程包括:S21、基于距离和密度权重选择初始聚类中心,包括:S211、从所有巡检点中随机选择一个巡检点作为第一个聚类中心;S212、分别计算其它各巡检点与聚类中心的距离D(w i ),以及其它各巡检点的密度权重ρ(w i );S213、根据距离和密度权重计算其它各巡检点被选为下一个聚类中心的概率,并选择概率值最大的巡检点作为下一个聚类中心:上式中,L(w i )为第i个巡检点w i 被选为下一个聚类中心的概率,D(w i )为w i 与聚类中心的距离,ρ(w i )为w i 的密度权重,I为巡检点的数量;S214、判断聚类中心数量是否达到目标值,即无人机数量值,若达到,则得到初始聚类中心;若未达到,则返回S212进行下一轮筛选;S22、将每个巡检点分配到距离它最近的聚类中心;S23、基于密度权重对聚类中心进行更新:上式中, 为更新后的第j个聚类中心,S j 为属于第j个聚类中心的所有巡检点;S24、循环重复S22-S23,直到满足迭代终止条件。
6.根据权利要求5所述的一种多无人机巡检轨迹和移动储能端调度巡检方法,其特征在于,所述S212中,D(w i )根据以下公式计算得到:上式中,d(w i ,e j )为第i个巡检点w i 到第j个聚类中心e j 的欧氏距离;ρ(w i )根据以下公式计算得到:上式中,δ为一个较小的正数。
7.一种多无人机巡检轨迹和移动储能端调度巡检系统,其特征在于,所述系统包括信息获取模块、巡检点分配模块、巡检轨迹优化模块、移动储能端充电调度模块;所述信息获取模块用于获取各无人机巡检点的位置信息;所述巡检点分配模块用于根据巡检点的分布以及无人机数量分配各无人机的巡检点;所述巡检轨迹优化模块用于基于各无人机的巡检点,采用基于多头自注意力机制的DDQN算法优化各无人机巡检轨迹;所述移动储能端充电调度模块用于优化确定移动储能端的充电调度策略,并控制移动储能端对无人机进行充电。
8.根据权利要求7所述的一种多无人机巡检轨迹和移动储能端调度巡检系统,其特征在于,所述巡检轨迹优化模块根据以下步骤优化各无人机巡检轨迹:A1、基于贪婪算法确定无人机的最优巡检点;A2、在当前时隙根据ε-greedy策略选择无人机的飞行速度v n ,并根据以下公式计算当前时隙的奖励r n :上式中,r a 为无人机飞去禁飞区的惩罚,d o,n 为无人机当前位置与巡检点的距离,d o,n+1 为无人机下一时隙位置与巡检点的距离,η为减少无人机巡检时隙的常数,且r a 、η均为负的常数;A3、将转移的结果(q n ,v n ,r n ,q n+1 )保存到经验池中,其中,q n 、q n+1 分别为无人机在当前时隙、下一时隙的位置;A4、随机从经验池中选择N 1 步样本,并使用梯度下降法减小神经网络的损失,从而优化无人机的巡检轨迹,获得更大的奖励,最终得到各无人机的最优巡检轨迹,其中,损失函数loss为:上式中,λ为折扣因子,Q(q n ,v n |θ)为当前dueling网络中无人机在位置q n 采取动作v n 的Q值, 为目标dueling网络中无人机在位置q n+1 采取动作 的Q值,θ、θ * 为影响神经网络模型参数的因子;所述dueling网络中引入了多头自注意力机制对状态价值函数和优势函数增强,增强后的Q函数为:V(q)=f V (h att (q))A(q,v)=f A (h att (q),v)Q i =W Q h(q)K j =W K h(q)V j =W V h(q)上式中,V(q)、A(q,v)分别为状态价值函数和优势函数,q、v分别为无人机所在的位置和采取的动作,B为可选择动作的个数,f V 用于从注意力增强的状态特征h att (q)计算状态价值V(q),h att (q)为注意力增强后的状态特征表示,f A 用于从注意力增强后的状态特征计算优势函数A(q,v),v i,j 为注意力权重,V j 为值向量,Q i 为查询向量,K j T 为键向量的转置,i为查询向量的索引,j为键向量和值向量的索引,d k 为键向量的维度,W Q 为将h(q)映射到查询向量空间的线性变换矩阵,W K 为将h(q)映射到键向量空间的线性变换矩阵,W V 为将h(q)映射到值向量空间的线性变化矩阵,h(q)为特征向量;A5、判断无人机当前电池能量是否小于设定的阈值,若大于,则移动储能端根据充电调度策略对无人机进行充电;若不小于,则进入A6;A6、判断无人机是否完成该巡检点的巡检任务,若未完成,则返回A2;若完成,则进入A7;A7、判断无人机是否完成所有巡检点的巡检任务,若未完成,则返回A1;若完成,则进入A8;A8、判断是否达到最大迭代次数,若未达到,则返回A1进行下一个无人机的巡检轨迹优化。
9.根据权利要求7或8所述的一种多无人机巡检轨迹和移动储能端调度巡检系统,其特征在于,所述移动储能端充电调度模块采用双向启发A*算法优化确定移动储能端的充电调度策略,该算法的流程包括:B1、初始化open_list和closed_list,将移动储能端的起点w s 加入open_list;B2、同时进行正向搜索和反向搜索,其中,正向搜索从起点开始,寻找通向目标的路径,反向搜索则从目标开始,寻找通向起点的路径,计算open_list中各节点的F值,选择F值最小的节点作为当前节点w c ,其中,各节点的F值由以下公式计算得到:F=f forward (b)+f backward (b)f forward (b)=g start (b)+h goal (b)f backward (b)=g goal (b)+h start (b)上式中,f forward (b)、f backward (b)分别为正向、反向搜索的预期总路径代价,g start (b)为从起点w s 到当前节点b的实际路径代价,h goal (b)为从当前节点b到目标节点w g 的预估代价,g goal (b)为从目标到当前节点b的反向搜索总路径代价,h start (b)为从当前节点b回到起点w s 的启发值;B3、将当前节点w c 从open_list移至closed_list中;B4、判断当前节点w c 的邻居节点是否为新节点或发现更短路径,若是,则将其加入open_list中;B5、判断当前节点w c 是否为目标节点w g 或open_list为空,若是,则输出移动储能端的最优路径,即移动储能端的充电调度方案;若不是,则返回B2。
10.根据权利要求7或8所述的一种多无人机巡检轨迹和移动储能端调度巡检系统,其特征在于,所述巡检点分配模块采用基于密度感知的K-Means++算法分配各无人机的巡检点,该算法的流程包括:C1、基于距离和密度权重选择初始聚类中心,包括:C11、从所有巡检点中随机选择一个巡检点作为第一个聚类中心;C12、根据以下公式,分别计算其它各巡检点与聚类中心的距离D(w i )以及其它各巡检点的密度权重ρ(w i ):上式中,d(w i ,e j )为第i个巡检点w i 到第j个聚类中心e j 的欧氏距离,δ为一个较小的正数,I为巡检点的数量;C13、根据距离和密度权重计算其它各巡检点被选为下一个聚类中心的概率,并选择概率值最大的巡检点作为下一个聚类中心:上式中,L(w i )为第i个巡检点w i 被选为下一个聚类中心的概率,D(w i )为w i 与聚类中心的距离,ρ(w i )为w i 的密度权重;C14、判断聚类中心数量是否达到目标值,即无人机数量值,若达到,则得到初始聚类中心;若未达到,则返回S212进行下一轮筛选;C2、将每个巡检点分配到距离它最近的聚类中心;C3、基于密度权重对聚类中心进行更新:上式中, 为更新后的第j个聚类中心,S j 为属于第j个聚类中心的所有巡检点;C4、循环重复C2-C3,直到满足迭代终止条件。



