有效
一种基于博弈论的多微网协同调度方法及系统
刘爱华、梅灿军、王荣强、吴非
杭州科工电子科技股份有限公司
摘要
本发明公开了一种基于博弈论的多微网协同调度方法及系统,方法包括:根据用户储能设备的荷电状态、充放电效率及电网实时调度需求,通过多智能体策略网络生成动态博弈初始策略集;基于动态博弈初始策略集,采用非对称纳什议价模型进行分布式协商,生成均衡利益分配方案;根据均衡利益分配方案,利用时间衰减型强化学习算法迭代修正储能优先级指标,生成包含供需弹性系数和风险补偿的动态竞价规则;基于动态竞价规则,通过去中心化梯度共识机制实时分配储能资源,生成最终协同调度指令并同步至各微网终端。利用本发明实施例,能够提升多微网系统的运行效率和自适应能力,满足未来智能配电网的需求。
1.一种基于博弈论的多微网协同调度方法,其特征在于,所述方法包括:根据用户储能设备的荷电状态、充放电效率及电网实时调度需求,构建时空耦合的博弈特征空间,通过多智能体策略网络生成动态博弈初始策略集,其中,所述动态博弈初始策略集包含各微网的充放电量及报价组合;其中,采集各微网储能设备实时荷电状态数据与历史充放电效率曲线,结合电网调度中心发布的区域负荷预测和电价波动信号,进行时空域插值处理,生成以15分钟为粒度的时空耦合状态矩阵;将时空耦合状态矩阵输入卷积递归混合神经网络,通过时间滑动窗口提取相邻微网间的充放电关联特征,输出包含供需关系强度与容量约束的博弈关系图谱;基于博弈关系图谱,构建多智能体策略网络的对抗训练环境,采用双层策略梯度算法同步优化各微网的充放电量策略与报价策略,生成包含Nash均衡约束的初始策略集合;对初始策略集合进行帕累托前沿筛选,剔除违反电网安全稳定运行约束的策略组合,输出动态博弈初始策略集;基于所述动态博弈初始策略集,采用非对称纳什议价模型进行分布式协商,通过虚拟资源交换市场动态调整各微网权重因子,生成均衡利益分配方案,其中,所述权重因子由用户信用等级和电网紧急度联合计算;根据所述均衡利益分配方案,利用时间衰减型强化学习算法迭代修正储能优先级指标,生成包含供需弹性系数和风险补偿的动态竞价规则;基于所述动态竞价规则,通过去中心化梯度共识机制实时分配储能资源,结合可验证随机函数验证分配有效性,生成最终协同调度指令并同步至各微网终端。
2.根据权利要求1所述的方法,其特征在于,所述基于所述动态博弈初始策略集,采用非对称纳什议价模型进行分布式协商,通过虚拟资源交换市场动态调整各微网权重因子,生成均衡利益分配方案,其中,所述权重因子由用户信用等级和电网紧急度联合计算,包括:解析初始策略集中的充放电量及报价组合,初始化非对称纳什议价模型的威胁点与议价空间,威胁点设置为微网独立运行时的最小收益阈值;根据微网用户的历史履约记录和电网节点电压越限概率,分别计算信用评分和紧急度系数,通过双曲正切函数融合两类参数生成初始权重因子;在虚拟资源交换市场中部署分布式协商协议以进行分布式协商,各微网基于当前权重因子对策略集进行利益效用计算,通过交替方向乘子法迭代更新议价解;当相邻两次迭代的夏普利值差异小于预设阈值时,触发权重因子动态调整机制,其中,信用等级下降的微网权重按指数衰减,电网紧急区域内的微网权重线性增加;根据最终协商结果生成包含转移支付方案与充放电时序计划的均衡利益分配方案,并通过零知识证明技术验证方案的个体理性与联盟稳定性。
3.根据权利要求2所述的方法,其特征在于,所述根据所述均衡利益分配方案,利用时间衰减型强化学习算法迭代修正储能优先级指标,生成包含供需弹性系数和风险补偿的动态竞价规则,包括:从均衡利益分配方案中提取各微网的历史中标率与收益波动数据,初始化储能优先级指标为供需比与风险值的加权函数;构建时间衰减型强化学习的状态转移模型,定义状态为电网实时负荷与储能可用容量差值,动作为优先级调整幅度,奖励函数包含电价套利收益与电网调节贡献度;采用衰减因子动态调整Q-learning算法的探索率,在负荷高峰时段增强历史经验权重,低谷时段提高随机探索概率,更新储能优先级指标的概率分布;根据更新后的优先级指标及其概率分布,计算价格变化率与成交量变化率的比值作为供需弹性系数,并基于条件风险价值模型量化储能调用风险补偿值;将供需弹性系数与储能调用风险补偿值编码为分段线性函数,生成包含阶梯报价上限与惩罚条款的动态竞价规则,并写入区块链的共识验证合约。
4.根据权利要求3所述的方法,其特征在于,所述基于所述动态竞价规则,通过去中心化梯度共识机制实时分配储能资源,结合可验证随机函数验证分配有效性,生成最终协同调度指令并同步至各微网终端,包括:在去中心化网络中广播动态竞价规则,各微网节点基于本地约束条件生成候选分配方案,并计算方案对全局目标函数的梯度向量;采用梯度共识算法聚合各节点梯度信息,通过投影次梯度下降法求解满足电网潮流约束的最优分配解,生成初步协同调度指令;调用可验证随机函数生成分布式随机数种子,各节点基于协同调度指令执行预提交操作并生成操作哈希,所有哈希值经门限签名聚合后与随机数比对验证一致性;当验证通过率超过95%时,将协同调度指令写入各微网终端的可信执行环境,否则触发弹性重分配机制,返回执行在去中心化网络中广播动态竞价规则,各微网节点基于本地约束条件生成候选分配方案,并计算方案对全局目标函数的梯度向量的步骤,以进行迭代优化直至收敛。
5.一种基于博弈论的多微网协同调度系统,其特征在于,所述系统包括:构建模块,用于根据用户储能设备的荷电状态、充放电效率及电网实时调度需求,构建时空耦合的博弈特征空间,通过多智能体策略网络生成动态博弈初始策略集,其中,所述动态博弈初始策略集包含各微网的充放电量及报价组合;其中,采集各微网储能设备实时荷电状态数据与历史充放电效率曲线,结合电网调度中心发布的区域负荷预测和电价波动信号,进行时空域插值处理,生成以15分钟为粒度的时空耦合状态矩阵;将时空耦合状态矩阵输入卷积递归混合神经网络,通过时间滑动窗口提取相邻微网间的充放电关联特征,输出包含供需关系强度与容量约束的博弈关系图谱;基于博弈关系图谱,构建多智能体策略网络的对抗训练环境,采用双层策略梯度算法同步优化各微网的充放电量策略与报价策略,生成包含Nash均衡约束的初始策略集合;对初始策略集合进行帕累托前沿筛选,剔除违反电网安全稳定运行约束的策略组合,输出动态博弈初始策略集;协商模块,用于基于所述动态博弈初始策略集,采用非对称纳什议价模型进行分布式协商,通过虚拟资源交换市场动态调整各微网权重因子,生成均衡利益分配方案,其中,所述权重因子由用户信用等级和电网紧急度联合计算;修正模块,用于根据所述均衡利益分配方案,利用时间衰减型强化学习算法迭代修正储能优先级指标,生成包含供需弹性系数和风险补偿的动态竞价规则;分配模块,用于基于所述动态竞价规则,通过去中心化梯度共识机制实时分配储能资源,结合可验证随机函数验证分配有效性,生成最终协同调度指令并同步至各微网终端。
6.根据权利要求5所述的系统,其特征在于,所述协商模块,具体用于:解析初始策略集中的充放电量及报价组合,初始化非对称纳什议价模型的威胁点与议价空间,威胁点设置为微网独立运行时的最小收益阈值;根据微网用户的历史履约记录和电网节点电压越限概率,分别计算信用评分和紧急度系数,通过双曲正切函数融合两类参数生成初始权重因子;在虚拟资源交换市场中部署分布式协商协议以进行分布式协商,各微网基于当前权重因子对策略集进行利益效用计算,通过交替方向乘子法迭代更新议价解;当相邻两次迭代的夏普利值差异小于预设阈值时,触发权重因子动态调整机制,其中,信用等级下降的微网权重按指数衰减,电网紧急区域内的微网权重线性增加;根据最终协商结果生成包含转移支付方案与充放电时序计划的均衡利益分配方案,并通过零知识证明技术验证方案的个体理性与联盟稳定性。
7.一种存储介质,其特征在于,所述存储介质中存储有计算机程序,其中,所述计算机程序被设置为运行时执行权利要求1-4中任一项所述的方法。
8.一种电子设备,包括存储器和处理器,其特征在于,所述存储器中存储有计算机程序,所述处理器被设置为运行所述计算机程序以执行权利要求1-4中任一项所述的方法。



