1.一种面向标签稀缺或分布不平衡场景的特定实体识别方法,其特征在于,包括以下步骤:S1、利用已标记的数据,以最小化去混淆的边际损失函数为目标,训练模型;S2、使用训练好的模型对未标记的数据进行预测,根据模型预测的类别置信度为每一条样本分配一个伪标签;S3、根据伪标签分布感知的自适应重采样策略,基于步骤S2得到的类别置信度,以上一轮自训练新加入的伪标注数据的标签分布分配权重,为每一条伪标注样本计算加权置信度得分,再利用平滑阈值函数以及伯努利采样最终确定样本是否被选取;S4、将采样出来的伪标注样本的伪标签作为其真实标签,将这部分数据从未标记数据集中删除,并与原始标记数据中的训练集合并,作为下一次迭代的训练集;S5、重复步骤S1~S4多次,直至模型收敛;S6、将待识别文本输入训练好的模型中进行预测。
2.根据权利要求1所述的面向标签稀缺或分布不平衡场景的特定实体识别方法,其特征在于,模型以Bert+BiLSTM+CRF模型作为骨干网络;当文本序列输入到网络中时,首先使用Bert预训练模型对文本进行预编码,获取每个字符的词向量;再采用BiLSTM网络进一步对向量进行下游编码,建模上下文信息;最后CRF作为解码器,将编码结果解码,由此得到实体标签序列。
3.根据权利要求1所述的面向标签稀缺或分布不平衡场景的特定实体识别方法,其特征在于,步骤S1中的去混淆的边际损失函数 由条件随机场损失 标签分布感知的边际损失 类抑制的混淆损失 三部分组成,公式如下:其中,λ 1 和λ 2 是超参数,表示不同损失的权重;条件随机场损失函数 是Bert+BiLSTM+CRF模型的原始损失函数;标签分布感知的边际损失函数 如下:其中 N j 表示第j类实体的数目,H是一个超参数,z j 代表模型将单词s判别为第j类实体的输出分数;类抑制的混淆损失函数 如下:其中ξ是一个分数阈值参数,σ(·)表示Sigmoid函数。
4.根据权利要求1所述的面向标签稀缺或分布不平衡场景的特定实体识别方法,其特征在于,步骤S3的具体选择方法为:S301、根据新加入的伪标注数据中的实体标签数量分布,将实体按数量降序排序,N 1 ≥N 2 ≥…≥N l ≥…≥N L ,赋予实体s权重μ s ,计算伪标注文本S i 加权置信度得分C i :l为实体的索引,δ、γ、ρ为超参数;S302、设计平滑阈值函数计算文本S i 被选中的概率为:C min 是一个得分阈值,α、β是超参数,α>0,β≥1;S303、对候选者进行伯努利采样,伯努利分布的采样概率p利用实体权重加权,其公式为:
5.根据权利要求1所述的面向标签稀缺或分布不平衡场景的特定实体识别方法,其特征在于,步骤S5中,在CRF层中采用维特比算法进行译码,选择分数最高的实体标签序列作为识别结果,后处理输出结构化识别结果。