1.一种基于BP神经网络的跨网络路由转发方法,其特征在于,应用于SDN控制器,包括:获取第一网络与第二网络间的网络状态数据;其中,所述网络状态数据包括网络时延、传送率、发送率和拥塞窗口大小;将所述网络状态数据输入至训练好的拥塞分析模型;其中,所述拥塞分析模型为通过多臂赌博机算法和ε-greedy算法优化的BP神经网络模型;基于所述拥塞分析模型的输出,确定对应于所述网络状态数据的拥塞状况分析结果,并根据所述拥塞状况分析结果,确定路由转发决策,通过所述路由转发决策实现所述第一网络与所述第二网络间的数据传输;所述BP神经网络模型通过多臂赌博机算法进行第一优化,具体地:以所述BP神经网络模型每两次训练间的损失函数的倒数作为奖励值,所述SDN控制器作为决策者,神经元组合作为摇臂,通过所述多臂赌博机算法对所述BP神经网络进行训练,获得经过第一优化的BP神经网络模型;在所述将所述网络状态数据输入至训练好的拥塞分析模型之前,还包括:通过ε-greedy算法,对经过第一优化过的BP神经网络模型进行第二优化,具体地:初始化各神经元组合的选择次数,并通过遍历算法选择各神经元组合的初始奖励值;生成在0和1之间的一随机数,当所述随机数大于ε时,选择具有最大历史奖励值的神经元组合作为神经网络隐藏层层数;否则,随机选择一种神经元组合作为神经网络隐藏层层数;根据每次训练后的损失函数值,更新每个神经元组合的奖励值和每个神经元组合的选择次数,直至满足所述ε-greedy算法的预设结束条件,获得训练好的拥塞分析模型。
2.如权利要求1所述的一种基于BP神经网络的跨网络路由转发方法,其特征在于,所述BP神经网络模型包括输入层、隐藏层和输出层;其中,所述输入层的神经元输出向量为 ;其中,t为所述BP神经网络模型的输入层层数,x i 为所述输入层第i个神经元的输出向量;所述隐藏层的神经元输出向量为 ;其中,k为所述BP神经网络模型的隐藏层层数,s h 为所述隐藏层第h个神经元的输出向量;所述输出层的神经元输出向量为 ;其中,r为所述BP神经网络模型的输出层层数,o j 为所述输出层第j个神经元的输出向量。
3.如权利要求2所述的一种基于BP神经网络的跨网络路由转发方法,其特征在于,所述隐藏层的激活函数为: ;其中,x为所述隐藏层的输入,所述输入层的输出;所述隐藏层第h个神经元的输出s h 为: ;其中,v ih 为所述输入层的神经元与所述隐藏层的神经元之间的网络权值。
4.如权利要求2所述的一种基于BP神经网络的跨网络路由转发方法,其特征在于,所述输出层的激活函数为: ;所述输出层第j个神经元的输出为: ;其中,w hj 为所述隐藏层的神经元与所述输出层的神经元之间的网络权值。
5.如权利要求2所述的一种基于BP神经网络的跨网络路由转发方法,其特征在于,所述BP神经网络模型的损失函数 为: ;其中,N为所述BP神经网络模型的样本个数,y为所述BP神经网络模型的实际训练样本的输出值, 为所述BP神经网络模型的期望输出,r为输入样本的数据维数。
6.如权利要求1所述的一种基于BP神经网络的跨网络路由转发方法,其特征在于,在所述将所述网络状态数据输入至训练好的拥塞分析模型之前,还包括:检测当前传输链路;当所述当前传输链路失效时,根据本地的路径转发表确定是否存在备用传输链路;当不存在备用传输链路时,生成当前链路失效报文,并向下游节点发送所述当前链路失效报文和带紧急标志的拓扑查询报文,以使所述下游节点切换传输路径或转发所述当前链路失效报文;当存在备用传输链路时,将当前网络传输路径从所述当前传输链路切换为所述备用传输链路,并更新所述路径转发表;向所述备用传输链路的链路节点发送路由通告报文,以使所述备用传输链路的链路节点根据所述路由通告报文,对所述路径转发表进行第二次更新。
7.如权利要求1至6任意一项所述的一种基于BP神经网络的跨网络路由转发方法,其特征在于,在所述获取第一网络与第二网络间的网络状态数据之前,还包括:所述第一网络用于接收用户访问请求,并对所述用户访问请求进行解析,获得源地址和目标访问地址;根据所述目标访问地址确定请求资源类型;若所述请求资源类型属于所述第二网络,则修改所述用户访问请求,并将所述修改后的用户访问请求发送至所述第二网络。
8.一种基于BP神经网络的跨网络路由转发装置,其特征在于,搭载于SDN控制器,所述跨网络路由转发装置包括获取模块、输入模块和分析转发模块;其中,所述获取模块用于获取第一网络与第二网络间的网络状态数据;其中,所述网络状态数据包括网络时延、传送率、发送率和拥塞窗口大小;所述输入模块用于将所述网络状态数据输入至训练好的拥塞分析模型;其中,所述拥塞分析模型为通过多臂赌博机算法和ε-greedy算法优化的BP神经网络模型;所述分析转发模块用于基于所述拥塞分析模型的输出,确定对应于所述网络状态数据的拥塞状况分析结果,并根据所述拥塞状况分析结果,确定路由转发决策,通过所述路由转发决策实现所述第一网络与所述第二网络间的数据传输;所述BP神经网络模型通过多臂赌博机算法进行第一优化,具体地:以所述BP神经网络模型每两次训练间的损失函数的倒数作为奖励值,所述SDN控制器作为决策者,神经元组合作为摇臂,通过所述多臂赌博机算法对所述BP神经网络进行训练,获得经过第一优化的BP神经网络模型;在所述输入模块将所述网络状态数据输入至训练好的拥塞分析模型之前,还包括:所述输入模块通过ε-greedy算法,对经过第一优化过的BP神经网络模型进行第二优化,具体地:初始化各神经元组合的选择次数,并通过遍历算法选择各神经元组合的初始奖励值;生成在0和1之间的一随机数,当所述随机数大于ε时,选择具有最大历史奖励值的神经元组合作为神经网络隐藏层层数;否则,随机选择一种神经元组合作为神经网络隐藏层层数;根据每次训练后的损失函数值,更新每个神经元组合的奖励值和每个神经元组合的选择次数,直至满足所述ε-greedy算法的预设结束条件,获得训练好的拥塞分析模型。