有效
基于数据对齐和隐私保护的多参与方纵向联邦学习方法
吴大鹏、程城、杨志刚、张普宁、王汝言、张鸿
重庆邮电大学
摘要
本发明涉及一种基于数据对齐和隐私保护的多参与方纵向联邦学习方法,属于数据安全领域。本发明通过融合多方数据的安全计算,满足数据隐私保护和数据协作方面的要求,同时支持用户解决数据泄露和隐私侵犯问题;本发明方法结合零知识证明和同态加密技术构建安全的多方数据对齐机制,通过高效的加密手段保护数据隐私,并利用多方私有集合交集计算实现对共同用户数据的安全识别,提高了数据协作的安全性和效率;本发明的违规处理与奖惩机制,通过第三方审查机构的监督,确保参与方在数据对齐和模型训练过程中遵守协议规定,防止数据滥用,增强了协议的可靠性和参与方的合规性。
1.一种基于数据对齐和隐私保护的多参与方纵向联邦学习方法,其特征在于:包括以下步骤:S1:协议初始化阶段:初始化协议,可信机构TA对ID进行注册并签名;S2:用户ID验证阶段:各参与方使用零知识证明证明其用户ID的合法性;S3:多方私有集合交集计算阶段:第三方审查机构TPA使用经过验证的用户ID哈希集合进行交集计算,确保交集集合中仅包含各方的真实用户ID;S4:加密验证与同态加密检查阶段:TPA通过加密验证和动态同态加密检查,确保各方仅在完整的交集用户集合 上进行训练;S5:违规处理与奖惩机制阶段:当检测到参与方存在违规行为时,TPA依据预定的奖惩机制进行处理;步骤S2具体包括以下步骤:S21:生成用户ID哈希:首先将用户持有的证书 与对应的用户ID集合 进行绑定;然后将绑定后的结果与用户ID集合一起进行用户ID哈希计算,每个参与方 将其用户ID集合 进行哈希转换,得到哈希集合:其中 为单向哈希函数,确保TPA无法还原用户ID的原始值;S22:生成零知识证明:参与方 对每个哈希值生成零知识证明 ,使得:其中,AC表示该ID满足真实性要求的属性;采用基于Schnorr协议的零知识证明流程:假设每个用户ID对应的哈希值 有一个秘密 来自用户ID的签名密钥,满足以下关系:其中 是生成元, 是大素数;证明者希望证明其知道 ,使得 成立,但不直接泄露 ;结合证书 中的相关信息,确保整个证明过程能够反映ID的真实性以及证书的有效性;S23:参与方 将哈希集合 、对应的零知识证明 以及绑定后的证书与ID集合一同提交给TPA;S24:验证零知识证明:TPA接收每个参与方 提交的哈希集合 、对应的零知识证明集合 以及绑定后的证书与ID集合,并执行以下验证步骤:首先从证书中获取可信机构的公钥,验证证书 的签名是否有效,检查证书是否在有效期内,以及证书中的 ID 信息与提交的ID集合是否一致;如果证书验证不通过,则直接判定该参与方提交的 ID 集合无效,标记为违规行为;如果证书验证通过,则验证零知识证明,对于每个 ,TPA使用验证算法 检查对应的证明 是否有效: ,如果验证通过,则将 记录为合法用户ID;否则,标记为无效;S25:记录合法用户ID哈希集合:验证完成后,TPA将每个参与方的合法用户ID哈希集合进行记录;步骤S3具体包括以下步骤:S31:MPSI的输入与加密逆布隆过滤器生成并发送给服务器端 ;S32:MPSI计算:服务器首先为用户ID集合中的每个元素计算哈希值,并在客户端的加密逆布隆过滤器中查找匹配项;服务器计算密文之和并重新随机化处理;服务器将加密结果分发给选定的客户端,客户端解密后反馈给服务器;服务器汇总解密结果,形成交集集合,提交给TPA确认后,用于联邦训练。
2.根据权利要求1所述的基于数据对齐和隐私保护的多参与方纵向联邦学习方法,其特征在于:步骤S1中所述协议初始化包括:协议中有 各方,各方持有的私密数据集合分别为 ,每个集合包含 个元素,协议的目标是通过安全计算得到交集: ;确保每一方只能在交集用户上进行训练;参与方中, 到 称为客户端, 为服务器端,TPA作为审查机构负责全程监督,TA为可信机构对ID进行注册并签名;所述可信机构TA对ID进行注册并签名,具体包括:每个参与方 将其用户的ID集合 发送给TA,TA对收到的每个ID进行验证,对于验证通过的ID,TA采用非对称加密算法,使用TA的私钥对ID相关信息进行签名,为参与方 颁发一个包含签名和TA公钥信息的证书 ,并发送回对应的参与方 保存。
3.根据权利要求1所述的基于数据对齐和隐私保护的多参与方纵向联邦学习方法,其特征在于:步骤S31所述MPSI的输入与加密逆布隆过滤器生成包括以下步骤:S311:输入:每个客户端 - 持有一个共享解密密钥 ,该密钥属于一种具有零解密算法ShDec0的加性同态门限加密方案;公钥 对所有方可见;S312:初始化:服务器 随机选择一组哈希函数 并发送给客户端;S313:本地加密的逆布隆过滤器生成:每个客户端执行以下步骤以生成加密的逆布隆过滤器,从而实现隐私保护的用户ID加密:计算其用户ID集合 的布隆过滤器 、获取布隆过滤器的逆布隆过滤器 、对 中的每个元素进行加密,得到加密后的逆布隆过滤器并发送给服务器端 。
4.根据权利要求1所述的基于数据对齐和隐私保护的多参与方纵向联邦学习方法,其特征在于:步骤S32中,服务器端 执行以下步骤以计算交集用户集合:对服务器持有的用户ID集合 中的每个元素 ,计算 个哈希值 ,并对每个哈希值 在各客户端的反布隆过滤器 中查找值: , 计算密文之和并重新随机化:服务器将结果 分发给 个客户端的任意 个客户端,并请求它们对每个 进行解密;合规检查:每个客户端 计算其解密份额 并将其反馈给服务端,具体如下:(1)客户端首先对 进行随机化处理,将随机化后的 发送回服务端,服务器将其组合为 并发送给各个客户端;(2)服务端汇总客户端反馈的解密份额 ,最终形成解密份额集合 ;TPA验证解密过程:TPA监督客户端的解密反馈过程,确保所有反馈都是通过安全通道发送,并防止服务端或客户端通过操纵反馈数据来干扰计算结果;TPA随机抽查客户端的反馈解密份额,确保解密过程合规;(3)服务端使用组合算法进行解密,对于每个 ,服务器使用组合算法计算: ;如果解密结果为零,即 ,则表示 在所有参与方的用户ID集合中,服务器将 添加到交集集合 中;否则,丢弃 ;最后交集用户集合输出:服务端 最终输出交集集合 ,并将结果提交给TPA进行最终确认;TPA对交集结果进行验证后,将合规的交集集合发送给各方。
5.根据权利要求1所述的基于数据对齐和隐私保护的多参与方纵向联邦学习方法,其特征在于:步骤S4具体包括以下步骤:S41:加密验证机制:每一轮训练开始前,TPA要求各方提交用于训练的用户ID的加密哈希集合 ,以验证训练数据的合规性;各方生成加密哈希集合,TPA验证这些集合与已知的完整交集集合是否一致;如果验证通过,表明各方在正确的交集用户上进行训练;如果失败,TPA将记录违规行为;S42:动态同态加密检查:TPA采用动态同态加密检查技术,以防止参与方在部分轮次中使用非交集用户数据;首先随机生成检查点:TPA在训练过程中的随机轮次生成检查点,要求各参与方重新提交加密的训练数据集合 ;然后同态加密验证:TPA在检查点使用同态加密技术,验证 是否与 一致,确保每轮训练数据均来自完整交集;S43:训练阶段:在确定共有实体后,各方使用这些共有实体的数据来协同地训练一个机器学习模型。
6.根据权利要求5所述的基于数据对齐和隐私保护的多参与方纵向联邦学习方法,其特征在于:步骤S43所述的训练阶段包括以下步骤:S431:可信协调者创建密钥对,并将公共密钥发送给客户端和服务端;S432:客户端和服务端对中间结果进行加密和交换,中间结果用来帮助计算梯度和损失值;S433:客户端和服务端计算加密梯度并分别加入附加掩码,服务端计算加密损失,客户端和服务端将加密的结果发送给可信协调者;S434:可信协调者对梯度和损失信息进行解密,并将结果发送回客户端和服务端;客户端和服务端解除梯度信息上的掩码,并根据这些梯度信息来更新模型参数。
7.根据权利要求1所述的基于数据对齐和隐私保护的多参与方纵向联邦学习方法,其特征在于:步骤S5具体包括以下步骤:违规检测:TPA在各关键步骤中使用零知识证明和加密验证技术,定期检查各方的合规性;处罚措施:对于确认违规的参与方,TPA将采取以下措施:(1)模型权重降低:减少其在联邦模型中的贡献权重;(2)经济罚款:对违规方施加经济处罚;(3)合作限制:在严重违规情况下,暂停其在联邦学习中的参与资格;奖励措施:对于合规的参与方,TPA颁发合规证书并给予适当奖励,以鼓励各方遵循协议。



