1.一种基于迭代学习的大规模光网络资源分配方法,其特征在于,包括:步骤一、初始化光网络拓扑、背景业务分布、当前业务请求;步骤二、根据当前光网络状态,计算所有节点的节点特征编码和所有链路的链路特征编码{v i },{e j },以及掩码向量M,上述共同构成决策Agent的输入状态S I ;步骤二所述计算所有节点的节点特征编码和所有链路的链路特征编码{v i },{e j },以及掩码向量M过程如下:根据拓扑结构关系、背景业务分布情况和当前业务请求状态,动态更新每个节点的节点特征编码v i 和每条链路的链路特征编码e j ;根据拓扑情况,计算得到一个掩码向量 N为当前拓扑节点数量;所述Agent是指:强化学习的智能体;所述每个节点的节点特征编码v i 是指:每个节点拥有一个K维节点特征编码 N为当前拓扑节点数量,其中:每个维度对应一项节点的特征;所述节点特征编码包括:经过当前节点的业务数、经过当前节点的业务占用时隙总数、频谱联通度、频谱联通块、距离当前业务终点的最短路径长度、节点标签;所述每条链路的链路特征编码e j 是指:每条链路拥有一个L维的链路特征编码 E为整个拓扑中边的数量;其中:每个维度对应一项链路的状态特征,根据网络状态和业务下发需求定制;所述链路特征编码包括:可用波长或频隙总数、第一个大块可用频谱的起始位置、最大连续可用频谱块的大小、链路碎片熵以及是否存在满足条件的频谱块;步骤三、根据输入状态S I ,Agent通过动作掩码机制过滤无效邻接节点,并选择合法邻接节点中的一个作为动作选择结果,即下一跳路由,并计算奖励函数值;步骤四、重复步骤二和三,直到满足当前业务的终止条件,根据终止条件判断当前业务是否可以成功路由,如果成功,根据First Fit策略选择波长或频隙;步骤五、将上述过程中,每次迭代生成的输入状态S I 、动作选择结果、奖励函数值记录下来用于Agent训练。
2.根据权利要求1所述的一种基于迭代学习的大规模光网络资源分配方法,其特征在于,所述网络拓扑包括:节点数、链路数、拓扑连接关系、链路上可用波长或频隙数;所述背景业务分布是指:在光网络中填充一定数量的随机背景业务,背景业务数量由网络负载率决定;所述当前业务请求包括:源节点、目的节点、带宽需求。
3.根据权利要求1所述的一种基于迭代学习的大规模光网络资源分配方法,其特征在于,所述动态更新是指:根据Agent节点选择的动态变化,实时更新所述v i 、e j ,每当一个新的节点加入部分解时,网络状态随之调整,并根据当前业务请求更新各链路的频谱资源使用情况;通过计算已选路径上链路的公共可用波长或频隙,更新所述v i 、e j ,确保Agent的输入状态S I 反映最新的网络资源情况;所述部分解是指:根据当前业务请求,由已经被决策Agent选择的节点构成的节点序列,但尚未构成由源节点到目的节点的完整路由。
4.根据权利要求1所述的一种基于迭代学习的大规模光网络资源分配方法,其特征在于,所述Agent中的模型采用边特征增强图神经网络结构,采用多层边特征增强的图注意力网络EGAT架构提取链路特征编码与节点特征编码之间的复杂耦合关系,捕捉输入状态S I 、动作选择结果、奖励函数值之间的关系和变化规律。
5.根据权利要求4所述的一种基于迭代学习的大规模光网络资源分配方法,其特征在于,所述多层边特征增强的图注意力网络EGAT中,链路特征编码e j 与节点特征编码v i 分别作为链路特征和节点特征送入神经网络中进行更新;通过多层边特征增强的图注意力网络EGAT,节点特征和链路特征进行迭代更新,结合邻接节点与链路的信息来优化路径选择。
6.根据权利要求1所述的一种基于迭代学习的大规模光网络资源分配方法,其特征在于,步骤三所述奖励函数值R的计算公式设计如下:其中:R为奖励值,是当前状态下的回报;R terminal 为终止奖励,当任务成功完成或出现异常时返回的固定奖励值;D为网络直径,表示网络中任意两个节点之间的最短路径的最大长度;P为惩罚值,根据部分频谱使用情况计算的惩罚值;S为步数,表示当前任务已经进行的步骤数;C为条件值,计算当前节点离目标节点的相对进展,正值表示正在接近目标,负值表示远离目标;所述条件值C的计算公式设计如下:C=μ·(γ·len(P last,dst )-len(P current,dst ))其中:μ:是比例因子或缩放因子,用于调整势能函数的影响程度;它控制了路径长度差异对奖励的贡献度;γ:是一个常数,用于调整路径长度差异的权重,在强化学习中用来控制长期回报的折扣因子;在本公式中用来加权计算从上一个节点到目标节点的最短路径长度;P current.dst :从当前节点到目标节点的最短路径长度。
7.根据权利要求1所述的一种基于迭代学习的大规模光网络资源分配方法,其特征在于,步骤四所述终止条件是指:到达终点、没有可选择的下一跳节点;已不存在可满足业务带宽需求的公共可用波长或频隙。
8.根据权利要求1所述的一种基于迭代学习的大规模光网络资源分配方法,其特征在于,步骤五还包括:通过多轮训练,智能体不断调整决策;每次训练后,利用交叉熵损失函数计算预测动作与实际动作之间的差异,并通过反向传播算法更新模型的权重;在训练过程中,采用学习率调度器来优化学习速率,提高模型的收敛速度。