1.信息不透明下巡飞弹对机动目标抵近搜索和精确打击方法,其特征在于,包括:步骤1:利用A*算法计算巡飞弹到达目标的航迹,并对该航迹进行平滑处理;步骤2:根据平滑处理后的航迹计算出制导律,并以制导律为动作、以巡飞弹的向量为状态利用深度学习网络进行交互学习,进而对制导律进行优化使得巡飞弹对目标完成精确打击;其中,步骤1中A*算法的回报函数为:g=α×q+β×b;式中,α、β分别代表两者的权重值;q为重要性概率的归一值;b为路程长度归一值;p为原始重要性概率,q+p=1;L long 为最长路程长度;L short 为最短路程长度;L now 为当前路程长度;其中,步骤2中深度学习网络的奖励函数为:式中, 表示第i个时间步修正后的单步奖励;r i 为第i个时间步修正前的单步奖励,即密集型事件引导回报和稀疏型终态回报之和;γ a 为衰减因子,τ为该回合智能弹药进行的总时间步数,G为该回合结束时获得的终态回报;其中,密集型事件引导回报函数为:r exp =w 1 ×(r 1 +r 2 )+w 2 ×r 3 ,式中,w 1 、w 2 分别表示上述密集回报的权重系数;其中,r 1 =dist mt_old -dist mt_now ;r 2 =v m ×cosε;r 3 =dist mo_now -dist mo_old ;式中,dist mt_old 表示智能弹药与目标上一时刻的距离,dist mt_now 表示智能弹药与目标当前时刻的距离;v m 表示智能弹药速度,ε表示智能弹药速度矢量与目标视线之间的夹角;dist mo_now 表示智能弹药与禁飞区当前时刻的距离,dist mo_old 表示智能弹药与禁飞区上一时刻的距离;其中,步骤2中巡飞弹的向量为:式中,dist mt 为弹目距离、y m 为弹药俯仰角、ψ m 为弹药偏航角、ε mt 为弹目视线倾角,β mt 为弹目视线偏角、v m 为弹药速度、D T 为时间约束,D V 为终端速度,D A 为终端角度。