1.一种基于强化学习的地址映射策略设计方法,其特征在于,用二进制可逆矩阵BIM表示地址映射策略,结合强化学习模型训练最佳行缓存命中率地址映射策略;该方法具体实现方式为:将二进制可逆矩阵BIM的一维展开作为强化学习模型的输入;将初始的BIM行缓存命中率作为强化学习模型当前的最佳值H best ;强化学习模型根据概率选择动作,得到候选BIM;当候选BIM计算得到的行缓存命中率比当前BIM高时,强化学习模型就会用候选的BIM替换当前的BIM;紧接着,重新计算奖励值,同时更新强化学习模型的参数;强化学习模型根据上述过程不断迭代优化,依据预设的停止规则,收敛获得训练好的BIM;同时获得行缓存命中率最高的地址映射策略;强化学习模型的动作空间数由二进制可逆矩阵BIM所有可能的行/列交换动作组成,即为 其中b是二进制可逆矩阵的行/列数;为解决强化学习模型的动作空间过大的问题,对强化学习模型的动作空间数进行压缩,具体如下:如下式所示,对BIM进行行交换通过在BIM左侧乘上一个转置矩阵M pre ;对BIM进行列交换通过在BIM右侧乘上一个转置矩阵M post :BIM满足交换律和结合律,一系列的行/列变换均用行变换来等价实现;因此,将动作空间压缩成只有行变换动作的集合;变换表达式如下:在上述动作空间压缩后,动作空间已经减少一半;为更大程度优化动作搜索空间,将二进制可逆矩阵BIM的变换强制成第一行和其他行的交换,可能动作总共是b-1个;同时,在动作空间中加入保持的动作NOP;强化学习模型的动作空间数最终被优化成b个动作。
2.根据权利要求1所述的一种基于强化学习的地址映射策略设计方法,其特征在于,强化学习模型由策略网络和价值网络组成;策略网络由两层级联的全连接层组成,在策略网络中第一层由ReLU作为激活函数,策略网络的第二层的输出以全连接的方式接Softmax函数;强化学习模型训练过程中,策略网络当前时刻会生成下一个动作a t ,当前时刻的BIM会根据动作进行变换生成下一时刻的BIM;在预设迭代次数k后,策略网络获得奖励值r k =H k ,H k 为k次迭代后BIM的行缓存命中率;累积奖励值的公式为:R t =γ k+1 r k其中,γ是折损因子;价值网络和策略网络中间结构一样,也由两层全连接层组成,区别在于,价值网络的输出是一个用来描述预测累积奖励值的数值;动作的优势的公式是用来表示在当前环境选取相应动作的奖励值相对于策略网络随机选择动作的优势;具体公式如下:A t =R t -V t其中,A t 是优势函数,V t 是在s t 状态下,依据策略π选择动作后估算的回报值;最大化的目标函数为:其中,J(θ)是最大化目标函数,用最大化J(θ)来不断优化神经网络模型的参数θ;π θ 是策略梯度算法,其是将策略π参数化成π θ ,即在对应的环境中学习得到最大化累积奖励值的策略;BIM t 表示当前的二进制可逆矩阵;策略梯度,即最大化目标函数的偏导,计算公式为:价值网络的损失函数为:价值网络的梯度为:价值函数V φ (BIM t )用来预测累积奖励值,通过策略梯度的方法来更新包含参数φ的神经网络;在强化学习模型中,使用的是反向传播算法计算参数的梯度值,lr π 和lr v 分别为策略网络和价值网络的学习率。
3.根据权利要求2所述的一种基于强化学习的地址映射策略设计方法,其特征在于,强化学习模型的参数按照Mini-batch的方法更新,并将一个Batch的梯度累加起来作为参数梯度,策略网络和价值网络的累积梯度为g θ 和g φ 。