1.一种面向并行训练的神经网络模型划分方法,其特征在于,包括:获取集群配置,所述集群配置包括用于表征集群的链路连接情况、集群的链路带宽情况、计算设备数量和计算节点类型的信息;根据所述集群配置中的链路种类,确定每个参数的划分方式以及每个链路对应的计算设备;基于所述每个参数的划分方式以及每个链路对应的计算设备确定通信组,所述通信组包括使用计算节点内对应链路与计算节点间的对应链路同时进行通信的参数;所述根据所述集群配置中的链路种类,确定每个参数的划分方式以及每个链路对应的计算设备,包括:根据所述集群配置中的第一类链路和第二类链路,确定每个参数的划分方式以及每个链路对应的计算设备,所述第一类链路为连接计算节点内计算设备的带宽链路,所述第二类链路为连接计算节点间计算设备的带宽链路,所述第一类链路和第二类链路是根据带宽划分的,同时通信时互不影响的链路。
2.根据权利要求1所述的方法,其特征在于,所述方法还包括:根据所述通信组对应的链路和包括的参数,并发启动各个通信组,以使各个通信组实现通信的并发执行。
3.根据权利要求1所述的方法,其特征在于,所述方法还包括:获取待训练的神经网络模型和训练数据;基于所述通信组和所述训练数据,对所述待训练的神经网络模型进行训练,直至得到训练完成的神经网络模型。
4.根据权利要求3所述的方法,其特征在于,所述基于所述通信组和所述训练数据,对所述待训练的神经网络模型进行训练,直至得到训练完成的神经网络模型,包括:基于所述通信组和所述训练数据,在每个计算节点内进行神经网络模型的前向传播;在每个计算节点内进行神经网络模型的反向传播,并进行节点内的梯度聚合;在计算节点间进行全局梯度更新,得到训练完成的神经网络模型。
5.根据权利要求4所述的方法,其特征在于,所述在每个计算节点内进行神经网络模型的反向传播,并进行节点内的梯度聚合,包括:从输出层开始,将损失函数的梯度沿网络反向传播,逐层计算每一层的梯度值;在计算得到每个计算设备的梯度值后,利用规约散射通信原语聚合来自所有计算设备的梯度,并在全部计算设备之间划分整个梯度,得到各个计算设备上的参数分片对应的梯度结果。
6.根据权利要求4所述的方法,其特征在于,所述在计算节点间进行全局梯度更新,得到训练完成的神经网络模型,包括:利用全规约通信原语规约各个计算设备的梯度结果,进行全局的梯度更新,得到训练完成的神经网络模型。
7.一种面向并行训练的神经网络模型划分系统,其特征在于,所述系统包括:获取单元,用于获取集群配置,所述集群配置包括用于表征集群的链路连接情况、集群的链路带宽情况、计算设备数量和计算节点类型的信息;第一确定单元,用于根据所述集群配置中的链路种类,确定每个参数的划分方式以及每个链路对应的计算设备;第二确定单元,用于基于所述每个参数的划分方式以及每个链路对应的计算设备确定通信组,所述通信组包括使用计算节点内对应链路与计算节点间的对应链路同时进行通信的参数;所述根据所述集群配置中的链路种类,确定每个参数的划分方式以及每个链路对应的计算设备,包括:根据所述集群配置中的第一类链路和第二类链路,确定每个参数的划分方式以及每个链路对应的计算设备,所述第一类链路为连接计算节点内计算设备的带宽链路,所述第二类链路为连接计算节点间计算设备的带宽链路,所述第一类链路和第二类链路是根据带宽划分的,同时通信时互不影响的链路。
8.一种电子设备,其特征在于,包括:存储器,处理器,及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述处理器执行所述计算机程序时,实现如权利要求1-6任一项所述的面向并行训练的神经网络模型划分方法。
9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有指令,当所述指令在终端设备上运行时,使得所述终端设备执行如权利要求1-6任一项所述的面向并行训练的神经网络模型划分方法。