有效
一种不确定环境下的数据中心任务调度方法及系统
丁肇豪、陈世洁、孙逸萌、王宣元、王泽森、李奇、刘蓁、王旭
华北电力大学(保定)
摘要
本发明涉及数据中心能源管理技术领域,具体涉及一种不确定环境下的数据中心任务调度方法及系统;本发明方法包括基于马尔可夫决策过程对数据中心的任务调度过程进行建模,得到任务调度模型,在任务调度模型中,任务的信息和电价作为不确定参数,采用分位数回归强化学习算法,选择任务调度动作,计算数据中心执行该任务后的奖励,将执行该任务后的状态、任务调度动作、奖励和下一状态存储在回放缓冲区中,从而得到不同任务调度分布策略数据,以长期累积折现奖励最大化,确定任务调度模型的任务调度最优分布策略;通过本发明方法可以实现不确定性感知的任务调度策略,可以有效提高数据中心的利润和完成率。
1.一种不确定环境下的能源感知数据中心任务调度方法,其特征在于,包括:基于马尔可夫决策过程对数据中心的任务调度过程进行建模,得到任务调度模型;在任务调度模型中,任务的信息和电价作为不确定参数;采用分位数回归强化学习算法,选择任务调度动作,计算数据中心执行该任务后的奖励,将执行该任务后的状态、任务调度动作、奖励和下一状态存储在回放缓冲区中,从而得到不同任务调度分布策略数据,以长期累积折现奖励最大化,确定任务调度模型的任务调度最优分布策略;所述任务调度模型包括MDP框架,MDP框架包括状态集、动作集,奖励函数集和折扣因子集;所述奖励函数集为:r n =e n -c n -b n ,其中,c n 为任务n的能耗成本,c n =∑ t∈S (p t *energy n ),energy n 为任务n每时间步长的IT设备能耗, 和 分别为空闲状态和满负荷状态下服务器m的功率,b n 为任务n的惩罚,t为时间,S为任务n的执行时间段,p t 为时间t的电价;所述分位数回归强化学习算法包括分位数回归时序差异学习算法,采用分位数回归时序差异学习算法,通过N q 个参数近似状态-动作价值分布 其中,F Z -1 是状态-动作价值 的累积分布函数的逆函数, 分位数 j为分位数标签,并且τ 0 =0,状态-动作价值分布 根据如下公式更新:其中, 是指示函数。
2.根据权利要求1所述的不确定环境下的能源感知数据中心任务调度方法,其特征在于,所述状态集为s n =(job n ,Ser,P′),其中,job n 为任务n的信息,job n =(u n ,ta n ,te n ,td n ,e n )n∈1,2,...,N,N为M台服务器的数据中心在T个时间步长内处理的任务总数,u n ,ta n ,te n ,td n ,e n 分别为任务的资源占用率、到达时间、执行时间、截止时间和计算收益,Ser为M台服务器的资源占用情况,Ser=(ser 1 ,...,ser m ,...,ser M ),ser m 为服务器m的资源占用情况,ser m =(ser m1 ,ser m1 ,...,ser mT ),P’为每个时间步长的预测电价,P’=(p′ 1 ,p′ 2 ,...,p′ T ),当前任务调度完成后,状态从s n 过渡到s n+1 ,任务信息job n 被转移到下一个任务信息job n+1 ,服务器的资源占用情况Ser会根据任务n的执行情况发生相应的变化;所述动作集为a n =(et n ,se n ),其中,et n 为执行时间和se n 为执行服务器,且et n >ta n ;所述折扣因子集为γ∈[0,1]。
3.根据权利要求2所述的不确定环境下的能源感知数据中心任务调度方法,其特征在于,所述长期累积折现奖励R=r 1 +γr 2 +...γ N-1 r N 。
4.根据权利要求3所述的不确定环境下的能源感知数据中心任务调度方法,其特征在于,所述以长期累积折现奖励最大化,确定任务调度模型的任务调度最优分布策略,包括:每个任务调度分布策略对应的状态-动作分布为:Q(s n ,a n )=E(r n +γQ(s n+1 ,a n+1 )),其中,Q为状态s n 下采取动作a n 的价值,E为期望值;即,最优分布策略满足:其中,π为策略函数,即在每个状态S n 下对应采取的动作a n 。
5.根据权利要求4所述的不确定环境下的能源感知数据中心任务调度方法,其特征在于,采用分布式强化学习计算每个任务调度分布策略对应的状态-动作价值分布Z(s n ,a n ),及其期望值为Q(s n ,a n ):Q(s n ,a n )=E(Z(s n ,a n ))
6.根据权利要求1所述的不确定环境下的能源感知数据中心任务调度方法,其特征在于,所述分位数回归时序差异学习算法的损失函数为:其中,k为常数,是分位数Huber损失阈值,u=r n +γZ(s n+1 ,a n+1 )-Z(s n ,a n )为时间差分误差。
7.根据权利要求6所述的不确定环境下的能源感知数据中心任务调度方法,其特征在于,所述采用分位数回归强化学习算法,确定任务调度模型的任务调度最优分布策略的过程包括:S201、初始化在线网络、目标网络、环境、分位数样本个数N q ,经验个数,批次大小N b ,目标网络更新频率F;S202、根据数据中心接收到的任务获得状态s n ,并作为神经网络的输入;S203、选择一个调度动作a n 并执行;S204、状态s n 转移为s n+1 ;S205、计算数据中心执行该任务后的奖励r n ;S206、将执行该任务后的状态、调度动作、奖励和下一状态储存到回放缓冲区中;S207、当回放缓冲区中储存数据数量大于N b 后,执行S208-S209,否则返回S202-S206;S208、从回放缓冲区中取样,计算样本的损失值并更新网络;S209、直到迭代次数大于目标网络更新频率F,更新目标网络,得到任务调度模型的任务调度最优分布策略。
8.一种不确定环境下的能源感知数据中心任务调度系统,其特征在于,包括任务调度模型建模模块和任务调度最优分布策略确定模块;任务调度模型建模模块,用于基于马尔可夫决策过程对数据中心的任务调度过程进行建模,得到任务调度模型;在任务调度模型中,任务的信息和电价作为不确定参数;任务调度最优分布策略确定模块,用于采用分位数回归强化学习算法,选择任务调度动作,计算数据中心执行该任务后的奖励,将执行该任务后的状态、任务调度动作、奖励和下一状态存储在回放缓冲区中,从而得到不同任务调度分布策略数据,以长期累积折现奖励最大化,确定任务调度模型的任务调度最优分布策略;所述任务调度模型包括MDP框架,MDP框架包括状态集、动作集,奖励函数集和折扣因子集;所述奖励函数集为:r n =e n -c n -b n ,其中,c n 为任务n的能耗成本,c n =∑ t∈S (p t *energy n ),energy n 为任务n每时间步长的IT设备能耗, 和 分别为空闲状态和满负荷状态下服务器m的功率,b n 为任务n的惩罚,t为时间,S为任务n的执行时间段,p t 为时间t的电价;所述分位数回归强化学习算法包括分位数回归时序差异学习算法,采用分位数回归时序差异学习算法,通过N q 个参数近似状态-动作价值分布 其中,F Z -1 是状态-动作价值 的累积分布函数的逆函数, 分位数 j为分位数标签,并且τ 0 =0,状态-动作价值分布 根据如下公式更新:其中, 是指示函数。
9.根据权利要求8所述的不确定环境下的能源感知数据中心任务调度系统,其特征在于,所述状态集为s n =(job n ,Ser,P′),其中,job n 为任务n的信息,job n =(u n ,ta n ,te n ,td n ,e n )n∈1,2,...,N,N为M台服务器的数据中心在T个时间步长内处理的任务总数,u n ,ta n ,te n ,td n ,e n 分别为任务的资源占用率、到达时间、执行时间、截止时间和计算收益,Ser为M台服务器的资源占用情况,Ser=(ser 1 ,...,ser m ,...,ser M ),ser m 为服务器m的资源占用情况,ser m =(ser m1 ,ser m1 ,...,ser mT ),P’为每个时间步长的预测电价,P′=(p′ 1 ,p′ 2 ,...,p′ T ),当前任务调度完成后,状态从s n 过渡到s n+1 ,任务信息job n 被转移到下一个任务信息job n+1 ,服务器的资源占用情况Ser会根据任务n的执行情况发生相应的变化;所述动作集为a n =(et n ,se n ),其中,et n 为执行时间和se n 为执行服务器,且et n >ta n ;所述折扣因子集为γ∈[0,1]。





