1.一种基于聊天室架构的分布并行强化学习模型训练方法,其特征在于,包括:根据消息中间件,构建聊天室架构的消息共享机制;所述消息共享机制是所述聊天室架构中多个节点通过所述消息中间件进行消息共享;将预先设置的强化学习模型的局部模型分别部署在各个所述节点中,通过各个所述节点产生的训练样本分别对各个所述节点中部署的局部模型进行训练,得到各个局部模型的更新参数;将所述更新参数保存为参数消息,并将所述参数消息利用所述消息中间件共享至所述聊天室架构中的其他所述节点;获取其他所述节点中的参数消息,将从其他所述节点中获取的参数消息与当前节点的参数消息进行聚合,得到训练后的强化学习模型,包括:获取其他所述节点中的参数消息;将获取的其他所述节点中的参数消息与当前节点的参数消息进行聚合,形成当前节点的优先级队列;从所述优先级队列中选取得分高于当前所述节点中部署的局部模型得分的局部模型,对选取的局部模型的参数取平均值,得到训练后的强化学习模型。
2.如权利要求1所述的基于聊天室架构的分布并行强化学习模型训练方法,其特征在于,根据消息中间件,构建聊天室架构的消息共享机制的步骤,包括:根据消息中间件,构建多个所述节点通过所述消息中间件在所述聊天室架构的通信总线;所述通信总线用于多个所述节点之间消息的发布与接收;根据所述通信总线,构建聊天室架构的消息共享机制;所述消息共享机制是所述聊天室架构中多个节点通过所述消息中间件进行消息共享;其中,发布消息采用aiozyre库中的接口shout,接收消息采用aiozyre库中的接口recv。
3.如权利要求2所述的基于聊天室架构的分布并行强化学习模型训练方法,其特征在于,所述聊天室架构包括多个主题;根据消息中间件,构建聊天室架构的消息共享机制,还包括:根据消息中间件,构建聊天室架构中同一主题下多个节点的消息共享机制。
4.如权利要求3所述的基于聊天室架构的分布并行强化学习模型训练方法,其特征在于,根据消息中间件,构建聊天室架构中同一主题下多个节点的消息共享机制的步骤,包括:将所述节点的id输入所述主题的主题列表;当输出所述节点加入所述主题列表成功的反馈信息,或,所述主题下其他节点接收到所述节点发布的消息时,确定所述节点加入所述主题列表成功。
5.如权利要求1所述的基于聊天室架构的分布并行强化学习模型训练方法,其特征在于,所述局部模型包括多个actor模型和learner模型;将预先设置的强化学习模型的局部模型分别部署在各个所述节点中,包括:将预先设置的强化学习模型的actor模型和learner模型分别部署在各个所述节点中;所述actor模型用于产生训练样本,所述learner模型用于更新局部模型的模型参数。
6.如权利要求5所述的基于聊天室架构的分布并行强化学习模型训练方法,其特征在于,通过各个所述节点产生的训练样本分别对各个所述节点中部署的局部模型进行训练,得到各个局部模型的更新参数的步骤,包括:利用节点id及模型配置参数分别初始化部署在各个节点中的所述actor模型和所述learner模型;向所述actor模型输入设置参数,获得训练样本;利用所述训练样本训练所述learner模型,获得各个局部模型的更新参数。
7.如权利要求6所述的基于聊天室架构的分布并行强化学习模型训练方法,其特征在于,利用所述训练样本训练所述learner模型,获得各个局部模型的更新参数的步骤,包括:分别以各个节点的所述训练样本作为输入,利用A2C算法进行多线程的各个节点的learner模型训练,每个节点的learner模型并行训练。
8.如权利要求1所述的基于聊天室架构的分布并行强化学习模型训练方法,其特征在于,将所述更新参数保存为参数消息,并将所述参数消息利用所述消息中间件共享至所述聊天室架构中的其他所述节点的步骤,包括:将所述更新参数保存为字典格式的参数消息,所述参数消息包括learner模型的深拷贝和learner模型的当前得分;所述字典格式为key-value,key=id,value=更新参数;将所述参数消息缓存到本地队列;将所述本地队列中的参数消息按先入先出的顺序利用所述消息中间件共享至所述聊天室架构中的其他所述节点。
9.一种基于聊天室架构的分布并行强化学习模型训练系统,其特征在于,包括:机制构建模块,用于根据消息中间件,构建聊天室架构的消息共享机制;所述消息共享机制是所述聊天室架构中多个节点通过所述消息中间件进行消息共享;参数更新模块,用于将预先设置的强化学习模型的局部模型分别部署在各个所述节点中,通过各个所述节点产生的训练样本分别对各个所述节点中部署的局部模型进行训练,得到各个局部模型的更新参数;消息共享模块,用于将所述更新参数保存为参数消息,并将所述参数消息利用所述消息中间件共享至所述聊天室架构中的其他所述节点;聚合模块,用于获取其他所述节点中的参数消息,将从其他所述节点中获取的参数消息与当前节点的参数消息进行聚合,得到训练后的强化学习模型,包括:获取其他所述节点中的参数消息;将获取的其他所述节点中的参数消息与当前节点的参数消息进行聚合,形成当前节点的优先级队列;从所述优先级队列中选取得分高于当前所述节点中部署的局部模型得分的局部模型,对选取的局部模型的参数取平均值,得到训练后的强化学习模型。