1.一种电力系统通信敏感信息识别方法,其特征在于包括如下步骤:(1)设计HybridSIR模型,HybridSIR模型包括BBS子模型、BBC子模型、第一变换层、第二变换层、第三变换层、第四变换层、首字符定位层,尾字符定位层及输出层,模型的输入为文本X,输出为文本X对应的敏感信息的BIOES标记序列l,模型损失函数包括BBS子模型损失函数和BBC子模型损失函数,BBS子模型损失函数为首字符概率层损失函数与尾字符概率层损失函数相加得到;BBC子模型损失函数为首字符标记层损失函数与尾字符标记层损失函数相加得到;(2)收集语料训练领域Bert,通过电力系统通信相关的网站获得中文语料,采用软件包对Bert进行训练,得到领域Bert;(3)构造数据集,收集一定规模的电力通信领域中的中文文本,利用句号、问号、感叹号、分号、省略号将文本分割为句子,然后对每个句子标注其中的敏感信息,标注方案采用BIOES方案,即B表示敏感信息的首字符,I表示敏感信息的内部字符,O表示敏感信息外部,E表示敏感信息的尾字符,S表示单字符敏感信息,对数据集中每个句子的BIOES标记序列进行变换以匹配BBS子模型和BBC子模型的输出;(4)训练和测试模型,构造的数据集按一定比例划分为训练集、验证集和测试集,加载到BBS和BBC子模型,依据公式定义的损失函数对模型进行训练和测试;(5)电力系统通信敏感信息识别,将未进行敏感信息标记的电力通信中文文本输入已训练完成的HybridSIR模型,输出层的输出即为敏感信息标记结果,完成敏感信息的识别;所述BBS子模型由通用Bert层、领域Bert层、语义拼接层、第一BiLSTM层、首字符概率层、尾字符概率层构成;BBC子模型由通用Bert层、领域Bert层、语义拼接层、第二BiLSTM层、首字符标记层、尾字符标记层构成;BBS子模型和BBC子模型共用通用Bert层、领域Bert层和语义拼接层;所述第一变换层、第二变换层、第三变换层和第四变换层分别将输入的概率向量或者标记序列变换为0-1向量;首字符定位层得到输入文本X中各字符是否为敏感信息首字符的0-1向量,并输出;尾字符定位层得到输入文本X中各字符是否为敏感信息尾字符的0-1向量,并输出。
2.根据权利要求1所述的电力系统通信敏感信息识别方法,其特征在于:所述通用Bert层和领域Bert层分别获取输入文本的字符级通用语义特征信息和字符级领域语义特征信息b g 和b d ;语义特征拼接层是将通用语义特征b g 和领域语义特征b d 拼接得到语义特征序列b,即b=(b g ,b d );第一BiLSTM层是将语义特征b转化为隐状态序列h s ,首字符概率层是得到输入文本X中各字符为敏感信息首字符的概率向量;尾字符概率层的功能是得到输入文本X中各字符为敏感信息尾字符的概率向量。
3.根据权利要求2所述的电力系统通信敏感信息识别方法,其特征在于:所述首字符概率层由第一全连接层和第一sigmoid层构成;输入隐状态序列h s ,依次经过第一全连接层和第一sigmoid层,得到概率向量c={c 1 ,c 2 ,c 3 ,…,c n },c i 表示x i 为敏感信息首字符的概率,其值为0到1之间;所述尾字符概率层由第二全连接层和第二sigmoid层构成;输入隐状态序列h s ,依次经过第二全连接层和第二sigmoid层,得到概率向量r={r 1 ,r 2 ,r 3 ,…,r n },r i 表示x i 为敏感信息尾字符的概率,其值为0到1之间。
4.根据权利要求1所述的电力系统通信敏感信息识别方法,其特征在于:第二BiLSTM层的功能是将语义特征b转化为隐状态序列h c, ,首字符标记层的功能是得到输入文本X中各字符是否为敏感信息首字符的BO标记序列;尾字符标记层的功能是得到输入文本X中各字符是否为敏感信息尾字符的EO标记序列。
5.根据权利要求4所述的电力系统通信敏感信息识别方法,其特征在于:所述首字符标记层由第三全连接层和第一CRF层构成;输入隐状态序列h c ,依次经过第三全连接层和第一CRF层,得到标记序列q={q 1 ,q 2 ,q 3 ,…,q n },q i 的值为标记’B’或者’O’,标记’B’表示敏感信息首字符,标记’O’表示非敏感信息首字符;所述尾字符标记层由第四全连接层和第二CRF层构成;输入隐状态序列h c ,依次经过第四全连接层和第二CRF层,得到标记序列v={v 1 ,v 2 ,v 3 ,…,v n },v i 的值为标记’E’或者’O’,标记’E’表示敏感信息尾字符,标记’O’表示非敏感信息尾字符。
6.根据权利要求1所述的电力系统通信敏感信息识别方法,其特征在于:第一变换层是将首字符概率层输出的概率向量c={c 1 ,c 2 ,c 3 ,…,c n }变换为0-1向量c’={c 1 ’,c 2 ’,c 3 ’,…,c n ’},变换公式如下:第二变换层是将尾字符概率层输出的概率向量r={r 1 ,r 2 ,r 3 ,…,r n }变换为0-1向量r’={r 1 ’,r 2 ’,r 3 ’,…,r n ’},变换公式如下:第三变换层是将首字符标记层输出的标记序列q={q 1 ,q 2 ,q 3 ,…,q n }变换为0-1向量q’={q 1 ’,q 2 ’,q 3 ’,…,q n ’},变换公式如下:第四变换层是将尾字符标记层输出的标记序列v={v 1 ,v 2 ,v 3 ,…,v n }变换为0-1向量v’={v 1 ’,v 2 ’,v 3 ’,…,v n ’},变换公式如下:输出层是根据首字符定位层输出的0-1向量c”={c 1 ”,c 2 ”,c 3 ”,…,c n ”}和尾字符定位层输出的0-1向量r”={r 1 ”,r 2 ”,r 3 ”,…,r n ”}得到输入文本X对应的敏感信息BIOES标记序列l。
7.根据权利要求1所述的电力系统通信敏感信息识别方法,其特征在于:BBS子模型有两个输出,即首字符概率层输出和尾字符概率层输出,对于首字符概率层,其损失函数为:其中 为首字符概率层的预期输出,c为该层的实际概率输出;对于尾字符概率层,其损失函数为:其中 为尾字符概率层的预期输出,r为该层的实际概率输出;BBS子模型损失函数总损失函数定义如下:BBC子模型有两个输出,即首字符标记层输出和尾字符标记层输出,对于首字符标记层,其损失函数为:其中, 为第一CRF层的预期输出标记序列, 为 对应的概率序列,Q表示所有可能的标记序列集合,q′为Q中一个可能的标记序列,得分函数score()的定义如下:其中,q={q 1 ,q 2 ,q 3 ,…,q n }为某标记序列,W={w 1 ,w 2 ,w 3 ,…,w n }为该标记序列对应的概率序列,其中w i 为标记总数大小的向量,表示文本第i个单词属于各个标记的概率,A为概率转移矩阵;对于尾字符标记层,其损失函数为:其中, 为第二CRF层的预期输出标记序列, 为 对应的概率序列,V表示所有可能的标记序列集合,v′为V中一个可能的标记序列,得分函数score()的定义如下:其中,v={v 1 ,v 2 ,v3,…,v n }为某标记序列,Z={z 1 ,z 2 ,z3,…,z n }为该标记序列对应的概率序列,其中z i 为标记总数大小的向量,表示文本第i个单词属于各个标记的概率,A’为概率转移矩阵;BBC子模型损失函数可定义如下: 。
8.一种电力系统通信敏感信息识别系统,用以实现如权利要求1-7任一所述的方法,其特征在于,包括,模型设计模块,用以设计电力系统通信敏感信息识别模型HybridSIR,HybridSIR模型包括BBS子模型、BBC子模型、第一变换层、第二变换层、第三变换层、第四变换层、首字符定位层,尾字符定位层及输出层;语料收集训练模块,用于收集电力系统通信相关的网站获得中文语料并对Bert进行训练;数据集构造模块,用以收集一定规模的电力通信领域中的中文文本,利用句号、问号、感叹号、分号、省略号将文本分割为句子,然后对每个句子标注其中的敏感信息,标注方案采用BIOES方案,即B表示敏感信息的首字符,I表示敏感信息的内部字符,O表示敏感信息外部,E表示敏感信息的尾字符,S表示单字符敏感信息,对数据集中每个句子的BIOES标记序列进行变换以匹配BBS子模型和BBC子模型模型的输出;模型训练和测试模块,用以将构造的数据集按比例划分训练集、验证集和测试集,加载到设计的BBS子模型和BBC子模型上,依据设计的BBS子模型损失函数和BBC子模型损失函数对数据集进行训练和测试;电力系统通信敏感信息识别模块,用以将未进行敏感信息标记的电力通信中文文本输入已训练完成的HybridSIR模型,输出层的输出即为敏感信息标记结果,完成敏感信息的识别。
9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有程序代码,所述程序代码被处理器执行时,实现如权利要求1-7任一所述的电力系统通信敏感信息识别方法的步骤。