1.一种强化学习声诱饵奖励值的计算方法,其特征在于,所述强化学习声诱饵奖励值的计算方法,包括:初始化吊放声纳的识别处理时间以及目标识别能力变量;基于所述目标识别能力变量计算潜艇使用预设数量的声诱饵对抗吊放声纳的目标成功率;基于所述吊放声纳识别处理时间以及所述目标识别能力变量计算所述声诱饵的平均识别处理时间;基于所述平均识别处理时间和所述目标成功率确定所述声诱饵的奖励值。
2.根据权利要求1所述的强化学习声诱饵奖励值的计算方法,其特征在于,基于所述平均识别处理时间和所述目标成功率计算所述声诱饵的奖励值之前,所述方法还包括:基于所述声诱饵定义对所述声诱饵进行处理的处理时间,所述处理时间用于对所述目标成功率进行加权处理。
3.根据权利要求2所述的强化学习声诱饵奖励值的计算方法,其特征在于,初始化吊放声纳识别处理时间,包括:定义吊放声纳单个检测周期,以及对每个所述声诱饵的识别时间。
4.根据权利要求2所述的强化学习声诱饵奖励值的计算方法,其特征在于,所述目标识别能力变量包括:识别真目标成功的识别率、识别真目标失败的识别率、识别假目标失败的识别率以及识别假目标成功的识别率;初始化目标识别能力变量,包括:将识别真目标成功的识别率设为α,将识别真目标失败的识别率设为1-α;将识别假目标失败的识别率设为1-β,将识别假目标成功的识别率设为β。
5.根据权利要求4所述的强化学习声诱饵奖励值的计算方法,其特征在于,基于所述目标识别能力变量计算潜艇使用预设数量的声诱饵对抗吊放声纳的目标成功率,包括:通过第一预设公式,以及所述目标识别能力变量计算潜艇使用预设数量的声诱饵计算所述目标成功率,所述第一预设公式为:其中,N为预设个数与真目标个数之和,i为识别真目标成功时所处识别的顺序位置。
6.根据权利要求4所述的强化学习声诱饵奖励值的计算方法,其特征在于,基于所述吊放声纳识别处理时间以及所述目标识别能力变量计算所述声诱饵的平均识别处理时间,包括:基于第二预设公式,以及所述吊放声纳识别处理时间以及所述目标识别能力变量计算所述声诱饵的平均识别处理时间,所述第二预设公式为:
7.一种强化学习声诱饵奖励值的计算装置,其特征在于,所述强化学习声诱饵奖励值的计算装置,包括:初始模块,所述初始模块用于初始化吊放声纳的识别处理时间以及目标识别能力变量;计算模块,所述计算模块用于基于所述目标识别能力变量计算潜艇使用预设数量的声诱饵对抗吊放声纳的目标成功率;基于所述吊放声纳识别处理时间以及所述目标识别能力变量计算所述声诱饵的平均识别处理时间;确定模块,所述确定模块用于基于所述平均识别处理时间和所述目标成功率确定所述声诱饵的奖励值。