有效
一种多任务强化学习的雷达资源动态分配方法及系统
白剑、张逍洋、杨刚、于沐尧、蔺震、郭亮、苏琪娅、史玥婷
北京遥感设备研究所
摘要
本申请提供一种多任务强化学习的雷达资源动态分配方法及系统,涉及多智能体强化学习多波束雷达资源分配技术领域,本申请通过空间碎片轨道参数、碰撞概率及雷达探测历史数据,构建矩阵划分其高、中、低威胁等级;接着,再配置多波束雷达系统,按威胁等级为目标分配不同增益波束;随后,采用分布式多智能体强化学习框架,为每部雷达部署智能体,智能体结合相关数据生成协同资源分配策略,调整波束指向与扫描周期;最后,集成威胁驱动奖励机制,依据碎片碰撞概率计算奖励权重,向高碰撞概率目标倾斜资源,实现策略调整,能够提升雷达对空间碎片的探测与跟踪效率。
1.一种多任务强化学习的雷达资源动态分配方法,其特征在于,包括:通过获取空间碎片的轨道参数、碰撞概率以及雷达探测历史数据,构建碎片威胁等级矩阵,所述碎片威胁等级矩阵将空间碎片划分为高、中、低威胁等级;配置多波束雷达系统,通过所述多波束雷达系统同步生成覆盖不同空间碎片簇的多个独立波束,根据所述碎片威胁等级矩阵中的威胁等级为不同威胁等级的目标分别分配不同增益级别的波束;采用分布式多智能体强化学习框架,为每部雷达部署专属的智能体,各智能体接收所述碎片威胁等级矩阵和所述多波束雷达系统的配置参数作为输入,通过交互空间碎片的位置、速度信息以及威胁等级数据,生成协同决策的雷达资源分配策略,并根据所述资源分配策略动态调整雷达波束指向和扫描周期;基于所述雷达资源分配策略,集成威胁驱动奖励机制,所述威胁驱动奖励机制以空间碎片的所述碰撞概率作为输入,通过线性或非线性变换计算奖励函数中的权重系数,并根据所述权重系数为高碰撞概率目标分配显著增加的奖励值,以引导资源向关键目标倾斜,实现所述雷达资源分配策略的调整;其中,采用分布式多智能体强化学习框架,为每部雷达部署专属的智能体,各智能体接收所述碎片威胁等级矩阵和所述多波束雷达系统的配置参数作为输入,通过交互空间碎片的位置、速度信息以及威胁等级数据,生成协同决策的雷达资源分配策略,并根据所述资源分配策略动态调整雷达波束指向和扫描周期,包括:采用分布式多智能体强化学习框架,为每部雷达部署专属智能体,为每个所述专属智能体绑定一个雷达标识符;所述专属智能体接收所绑定雷达的当前波束指向坐标、扫描周期参数、所述碎片威胁等级矩阵中与所绑定雷达关联的空间碎片簇的威胁等级、邻近雷达的波束指向坐标,作为输入;通过通信网络交互邻近智能体的观测信息,所述观测信息包括空间碎片的位置偏移量、速度矢量、威胁等级数据,每个智能体将自身的所述观测信息与邻近智能体的所述观测信息整合,生成协同决策的雷达资源分配策略;根据所述雷达资源分配策略,生成包括波束指向调整角度、扫描周期增减量的动态调整指令,各专属智能体同步执行所述动态调整指令,对应更新绑定雷达的波束指向和扫描周期。
2.根据权利要求1所述的方法,其特征在于,通过通信网络交互邻近智能体的观测信息,所述观测信息包括空间碎片的位置偏移量、速度矢量、威胁等级数据,每个智能体将自身的所述观测信息与邻近智能体的所述观测信息整合,生成协同决策的雷达资源分配策略,包括:每个智能体通过通信网络,以固定时间间隔发送自身附加时间戳和智能体标识符的观测信息,接收邻近智能体发送的观测信息,并校验接收到的所述观测信息的完整性和时效性;将自身的所述观测信息与接收到的校验过的邻近智能体的所述观测信息进行加权融合,生成综合位置偏移量和综合速度矢量,所述观测信息包括空间碎片的位置偏移量、速度矢量、威胁等级数据;基于所述综合位置偏移量、综合速度矢量和威胁等级数据,推导波束指向优化参数和扫描周期调整量,形成协同决策的雷达资源分配策略。
3.根据权利要求1所述的方法,其特征在于,基于所述雷达资源分配策略,集成威胁驱动奖励机制,所述威胁驱动奖励机制以空间碎片的所述碰撞概率作为输入,通过线性或非线性变换计算奖励函数中的权重系数,并根据所述权重系数为高碰撞概率目标分配显著增加的奖励值,以引导资源向关键目标倾斜,实现所述雷达资源分配策略的调整,包括:在分布式多智能体强化学习框架中,基于所述雷达资源分配策略输出的波束指向和扫描周期参数,集成威胁驱动奖励机制;将空间碎片的所述碰撞概率输入所述威胁驱动奖励机制,通过指数函数变换计算权重系数,所述指数函数的底数为固定常数且指数项为碰撞概率的缩放值;基于所述雷达资源分配策略输出的波束指向和扫描周期参数,计算实际跟踪轨迹与预测轨迹的位置偏差,将其作为奖励函数的基础项;将所述权重系数与所述基础项相乘,得到加权奖励值,其中高碰撞概率目标的权重系数显著大于低碰撞概率目标;在强化学习训练过程中,当智能体分配资源至高碰撞概率目标时,所述加权奖励值的增幅超过线性增长阈值,根据所述加权奖励值更新策略网络的参数,驱动资源分配策略向高碰撞概率目标倾斜。
4.根据权利要求3所述的方法,其特征在于,将空间碎片的所述碰撞概率输入所述威胁驱动奖励机制,通过指数函数变换计算权重系数,所述指数函数的底数为固定常数且指数项为碰撞概率的缩放值,包括:将所述空间碎片的碰撞概率数据输入威胁驱动奖励机制的数据接收接口,对接收到的所述碰撞概率数据进行数值范围检查,筛选出有效概率值,剔除超出预设范围的异常值;对筛选后的有效概率值进行线性映射处理,将其转换到标准数值区间,生成标准化概率值,使用预定义的缩放因子对所述标准化概率值进行比例调整,生成指数项的输入参数;以固定常数为计算基数,以所述指数项的输入参数为幂指数,执行幂函数运算,并对幂函数运算结果进行输出范围约束,得到权重系数。
5.根据权利要求1所述的方法,其特征在于,配置多波束雷达系统,通过所述多波束雷达系统同步生成覆盖不同空间碎片簇的多个独立波束,根据所述碎片威胁等级矩阵中的威胁等级为不同威胁等级的目标分别分配不同增益级别的波束,包括:根据空间碎片的空间位置分布,将同一轨道高度且方位角重叠的碎片划分为同一空间碎片簇,生成多个空间碎片簇的几何中心坐标;配置多波束雷达系统,通过所述多波束雷达系统生成与所述空间碎片簇数量相同的多个独立波束,每个所述独立波束指向一个空间碎片簇的所述几何中心坐标;为每个所述独立波束设置可调增益级别,所述增益级别包括低档增益、中档增益、高档增益,分别对应发射功率的递增梯度;根据所述碎片威胁等级矩阵中的威胁等级,统计每个空间碎片簇内高威胁等级碎片的占比值,若所述占比值超过第一阈值则分配高档增益,若所述占比值低于第二阈值则分配低档增益,其余分配中档增益;将根据所述高档增益、中档增益、低档增益的级别分配结果,驱动所述多波束雷达系统按指令生成指定增益级别的独立波束。
6.根据权利要求1所述的方法,其特征在于,通过获取空间碎片的轨道参数、碰撞概率以及雷达探测历史数据,构建碎片威胁等级矩阵,所述碎片威胁等级矩阵将空间碎片划分为高、中、低威胁等级,包括:获取空间碎片的轨道高度、轨道倾角、偏心率参数,以及空间碎片与保护目标的碰撞概率,并提取雷达探测历史数据中的碎片尺寸、材质类型;将所述轨道高度、轨道倾角、偏心率参数划分为低、中、高数值区间,分别对应轨道状态风险等级的稳定、中等、高风险状态,将所述碰撞概率按预设阈值划分为低、中、高碰撞概率等级,将所述碎片尺寸和材质类型组合映射为结构危险性等级;基于所述轨道状态风险等级、碰撞概率等级、结构危险性等级,构建三维分级量化表,将每个空间碎片的三个维度参数输入所述分级量化表,输出综合威胁评分;根据所述综合威胁评分划分阈值范围,将空间碎片划分为低、中、高威胁等级,生成包含所有空间碎片及其对应威胁等级的碎片威胁等级矩阵。
7.一种多任务强化学习的雷达资源动态分配系统,其特征在于,包括:获取模块,用于通过获取空间碎片的轨道参数、碰撞概率以及雷达探测历史数据,构建碎片威胁等级矩阵,所述碎片威胁等级矩阵将空间碎片划分为高、中、低威胁等级;分配模块,用于配置多波束雷达系统,通过所述多波束雷达系统同步生成覆盖不同空间碎片簇的多个独立波束,根据所述碎片威胁等级矩阵中的威胁等级为不同威胁等级的目标分别分配不同增益级别的波束;交互模块,用于采用分布式多智能体强化学习框架,为每部雷达部署专属的智能体,各智能体接收所述碎片威胁等级矩阵和所述多波束雷达系统的配置参数作为输入,通过交互空间碎片的位置、速度信息以及威胁等级数据,生成协同决策的雷达资源分配策略,并根据所述资源分配策略动态调整雷达波束指向和扫描周期;调整模块,用于基于所述雷达资源分配策略,集成威胁驱动奖励机制,所述威胁驱动奖励机制以空间碎片的所述碰撞概率作为输入,通过线性或非线性变换计算奖励函数中的权重系数,并根据所述权重系数为高碰撞概率目标分配显著增加的奖励值,以引导资源向关键目标倾斜,实现所述雷达资源分配策略的调整;其中,采用分布式多智能体强化学习框架,为每部雷达部署专属的智能体,各智能体接收所述碎片威胁等级矩阵和所述多波束雷达系统的配置参数作为输入,通过交互空间碎片的位置、速度信息以及威胁等级数据,生成协同决策的雷达资源分配策略,并根据所述资源分配策略动态调整雷达波束指向和扫描周期,包括:采用分布式多智能体强化学习框架,为每部雷达部署专属智能体,为每个所述专属智能体绑定一个雷达标识符;所述专属智能体接收所绑定雷达的当前波束指向坐标、扫描周期参数、所述碎片威胁等级矩阵中与所绑定雷达关联的空间碎片簇的威胁等级、邻近雷达的波束指向坐标,作为输入;通过通信网络交互邻近智能体的观测信息,所述观测信息包括空间碎片的位置偏移量、速度矢量、威胁等级数据,每个智能体将自身的所述观测信息与邻近智能体的所述观测信息整合,生成协同决策的雷达资源分配策略;根据所述雷达资源分配策略,生成包括波束指向调整角度、扫描周期增减量的动态调整指令,各专属智能体同步执行所述动态调整指令,对应更新绑定雷达的波束指向和扫描周期。
8.一种电子设备,其特征在于,包括:存储器,用于存储计算机程序;处理器,用于执行所述计算机程序时实现如权利要求1至6任一项所述的多任务强化学习的雷达资源动态分配方法的步骤。
9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有计算机程序,所述计算机程序被处理器执行时能够实现如权利要求1至6中任一项所述的多任务强化学习的雷达资源动态分配方法。




