1.一种意图光网络冲突解决方法,其特征在于,包括:获取用户意图:将所述用户意图输入多意图冲突协商模型,得到所述多意图冲突协商模型输出的意图冲突解决策略;其中,产生冲突的每个用户意图被建模为具有强化学习能力的一个智能体,所述多意图冲突协商模型是基于多智能体强化学习训练得到的;所述多意图冲突协商模型为多智能体强化学习模型;所述意图冲突解决策略包括:其中,R i 表示第i个智能体的意图冲突解决策略;u i (r)表示意图冲突协商后第i个智能体的运营商收益函数;p i 表示意图冲突协商后由于部分业务被降级处理导致的第i个智能体的损失;π表示第i个智能体的动作策略。
2.根据权利要求1所述的方法,其特征在于,所述方法还包括:基于多智能体强化学习训练,确定所述多意图冲突协商模型;其中,所述多智能体强化学习的训练目标为使得多智能体的整体策略达到纳什均衡,从而确定所述意图冲突解决策略。
3.根据权利要求2所述的方法,其特征在于,每个智能体的意图冲突解决策略满足第二条件,所述第二条件为:其中,s i 表示第i个智能体的智能体状态;π i 表示第i个智能体的动作策略;S i 的表示第i个智能体的状态空间;V i ()表示第i个智能体自身的期望回报;Π i 表示第i个智能体的策略空间; 表示所有智能体的策略空间; 表示除第i个智能体以外所有智能体的策略空间。
4.根据权利要求2所述的方法,其特征在于,基于多智能体强化学习训练,确定所述多意图冲突协商模型,包括:针对产生冲突的多个用户意图,获取不同类型用户意图的运营商计费方式;获取意图冲突时间段内,各个智能体的状态空间、动作空间、奖励函数以及状态转移函数;根据各个智能体的运营商计费方式、状态空间、动作空间、奖励函数以及状态转移函数进行强化学习训练,得到所述多意图冲突协商模型;其中,所述智能体的状态空间为意图冲突时间段内所述智能体所感知的链路环境信息;所述智能体的动作空间为在满足用户意图的前提下,该用户意图为解决冲突可变动的范围;所述奖励函数为在能够解决当前冲突的前提下,运营商的收益;所述状态转移函数为常函数。
5.根据权利要求4所述的方法,其特征在于,所述链路环境信息包括以下至少一项:智能体需要使用的带宽资源;智能体的丢包率;智能体的时延要求;智能体的抖动。
6.根据权利要求4所述的方法,其特征在于,所述动作空间包括以下至少一项:带宽容忍量;丢包容忍量;时延容忍量。
7.根据权利要求4所述的方法,其特征在于,根据各个智能体的运营商计费方式、状态空间、动作空间、奖励函数以及状态转移函数进行强化学习训练的训练方式,包括:通过训练一个非线性函数来逼近多意图冲突协商模型的策略函数F;其中,所述非线性函数为:S'=F(s,a)其中,在状态s下通过执行动作a,以达到状态S'。
8.一种意图光网络冲突解决装置,其特征在于,包括:获取模块,用于获取用户意图:冲突解决模块,用于将所述用户意图输入多意图冲突协商模型,得到所述多意图冲突协商模型输出的意图冲突解决策略;其中,产生冲突的每个用户意图被建模为具有强化学习能力的一个智能体,所述多意图冲突协商模型是基于多智能体强化学习训练得到的;所述多意图冲突协商模型为多智能体强化学习模型;所述意图冲突解决策略包括:其中,R i 表示第i个智能体的意图冲突解决策略;u i (r)表示意图冲突协商后第i个智能体的运营商收益函数;p i 表示意图冲突协商后由于部分业务被降级处理导致的第i个智能体的损失;π表示第i个智能体的动作策略。
9.根据权利要求8所述的装置,其特征在于,所述装置还包括:训练模块,用于基于多智能体强化学习训练,确定所述多意图冲突协商模型;其中,所述多智能体强化学习的训练目标为使得多智能体的整体策略达到纳什均衡,从而确定所述意图冲突解决策略。
10.根据权利要求9所述的装置,其特征在于,每个智能体的意图冲突解决策略满足第二条件,所述第二条件为:其中,s i 表示第i个智能体的智能体状态;π i 表示第i个智能体的动作策略;S i 的表示第i个智能体的状态空间;V i ()表示第i个智能体自身的期望回报;Π i 表示第i个智能体的策略空间; 表示所有智能体的策略空间; 表示除第i个智能体以外所有智能体的策略空间。
11.根据权利要求9所述的装置,其特征在于,所述训练模块包括:第一子模块,用于针对产生冲突的多个用户意图,获取不同类型用户意图的运营商计费方式;第二子模块,用于获取意图冲突时间段内,各个智能体的状态空间、动作空间、奖励函数以及状态转移函数;训练子模块,用于根据各个智能体的运营商计费方式、状态空间、动作空间、奖励函数以及状态转移函数进行强化学习训练,得到所述多意图冲突协商模型;其中,所述智能体的状态空间为意图冲突时间段内所述智能体所感知的链路环境信息;所述智能体的动作空间为在满足用户意图的前提下,该用户意图为解决冲突可变动的范围;所述奖励函数为在能够解决当前冲突的前提下,运营商的收益;所述状态转移函数为常函数。
12.根据权利要求11所述的装置,其特征在于,所述链路环境信息包括以下至少一项:智能体需要使用的带宽资源;智能体的丢包率;智能体的时延要求;智能体的抖动。
13.根据权利要求11所述的装置,其特征在于,所述动作空间包括以下至少一项:带宽容忍量;丢包容忍量;时延容忍量。
14.根据权利要求11所述的装置,其特征在于,根据各个智能体的运营商计费方式、状态空间、动作空间、奖励函数以及状态转移函数进行强化学习训练的训练方式,包括:通过训练一个非线性函数来逼近多意图冲突协商模型的策略函数F;其中,所述非线性函数为:S'=F(s,a)其中,在状态s下通过执行动作a,以达到状态S'。
15.一种意图光网络冲突解决装置,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的程序;其特征在于,所述处理器执行所述程序时实现如权利要求1-7任一项所述的意图光网络冲突解决方法。
16.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现如权利要求1-7任一项所述的意图光网络冲突解决方法中的步骤。