1.一种基于强化学习的卫星任务规划演化方法,其特征在于,所述方法包括:步骤1、初始化算法参数,初始化Q值表;步骤2、若评价次数num_eval<最大函数值评价次数,则执行步骤3,否则执行步骤11;步骤3、计算Q值表中的 得到动作被选中的概率;其中, 表示第i个状态,T为控制参数,a j 表示动作j,Q t 表示t时刻的Q值;步骤4、基于步骤3的结果,选中一个动作及一个个体,令循环变量p从1至 单次增加1进行循环,进行个体交叉变异,获得新个体,针对新个体形成规划方案,计算目标函数值;其中, 表示种群规模;步骤5、基于新个体计算reward之后更新Q值,得到新的Q值表;步骤6、从当代种群中搜索最优目标函数值及其在种群中对应的位置序号;步骤7、若当代种群最优目标函数值大于搜索过程中最优目标函数值,则将搜索过程最优目标函数值更新为当代种群最优目标函数值,并将搜索过程最优个体更新为当代种群最优个体;否则,当 小于阈值 时,将当代种群最优个体用搜索过程最优个体替代,并将当前种群最优函数值更新为搜索过程最优函数值;步骤8、若当代最优目标函数值差于上一代最优目标函数值,则目标函数值控制参数count加1;步骤9、更新时刻t,令t=t+1;步骤10、将当代种群最优适应度函数值更新为上一代种群最优函数值,返回步骤2;当满足评价次数num_eval等于最大函数值评价次数条件时,执行步骤11;步骤11、保存最终的种群最优函数值对应的最优个体,将最优个体对应的执行方案作为优化方案;所述适应度函数值使用目标函数值表示,所述目标函数为:其中, 表示带宽设定对应的增益函数, 表示重要性程度, 表示基于重要性程度设置的带宽, 表示探测任务j的探测增益,i表示第i个卫星,S表示卫星集合,T表示任务集合,o表示轨道, 表示卫星i的轨道集合,k表示一时间窗,TW表示时间窗集合, 表示卫星 是否在轨道 上的第 个时间窗是否执行任务 ;所述探测增益 的求解方式为:其中, , 和 分别为1阶和3阶第一类贝塞尔函数, 为卫星天线与信号源中心的夹角, 为天线效率,λ表示波长, 是天线增益相对于波束中心3dB衰减处的角度,D表示天线口径。
2.根据权利要求1所述的方法,其特征在于,所述步骤1中的初始化,包括构造一初始解,个体表示与任务序列的序号一一对应。
3.根据权利要求1所述的方法,其特征在于,所述步骤4中,所述交叉变异中,使用多种长度交叉算子,交叉算子的长度由任务序列中选择的片段长度决定。
4.根据权利要求1所述的方法,其特征在于,所述步骤5中,新的Q值表中,Q值更新的计算方式为:其中, , 表示学习率, 表示折扣因子,F t 表示目标函数值,S t 表示状态,A t 表示动作。
5.根据权利要求1所述的方法,其特征在于,所述Q值表中记录搜索过程中全部交叉、变异组合的表现值,Q值表中的Q值使用状态-动作组合表示,对于每一代中的一智能体,其在状态 下采取动作 的概率表示为:其中, 表示时刻t对于状态和动作的Q值,T表示控制参数。
6.根据权利要求1所述的方法,其特征在于,所述步骤4中,使用任务时间窗选择算法形成规划方案,所述任务时间窗选择算法包括:步骤01、按照任务顺序逐个尝试安排任务,如果已经尝试完毕,则执行步骤03,否则执行步骤02;步骤02、逐个尝试时间窗集合中的时间窗,如果全部尝试完毕,则转至步骤01尝试安排下一任务;如果全部任务安排完毕,则执行步骤03;步骤03、输出任务规划方案。
7.一种基于强化学习的卫星任务规划演化系统,其特征在于,所述系统应用于权利要求1-6任一所述的基于强化学习的卫星任务规划演化方法,该系统包括:数据输入模块,用于输入原始数据,所述原始数据包括任务数据、原始时间窗数据;初始化模块,用于初始化算法参数,及初始化Q值表;最优方案计算模块,用于通过种群算法及Q值表更新算法,获得优化方案;任务时间窗选择模块,与所述优化方案模块进行数据交互,并基于所述最优方案计算模块的传送数据,形成任务规划方案;所述传送数据包括:任务集合、时间窗集合、任务序列。
8.一种基于强化学习的卫星任务规划演化设备,其特征在于,所述设备包括处理器、存储器,所述处理器可以调用所述存储器中的计算机指令以执行如权利要求1-6所述的基于强化学习的卫星任务规划演化方法。