1.一种基于提示对比学习的持续学习下小样本关系抽取方法,其特征在于,所述方法包括:获取任务集和初始CFRE模型;所述任务集中包含多个任务;所述每个任务包含各自的训练数据集;所述数据集包含多个训练样本;所述训练样本包括多个句子;对任务中的句子进行信息增强,得到增强后的句子;根据预先构建的模板映射函数对所述增强后的句子进行映射,得到基于提示的数据;将所述基于提示的数据输入预训练BERT模型获得句子的向量表示,根据句子的向量表示计算得到标签集上的概率分布;利用投影头将所述句子的向量表示映射到低维嵌入空间,得到隐藏表示;对所述隐藏表示进行归一化处理,得到规范化嵌入表示;在每个任务中根据所述标签集上的概率分布、隐藏表示、规范化嵌入表示和数据增强策略构建初始CFRE模型的总损失函数,利用所述训练数据集和所述总损失函数对初始CFRE模型进行训练,最小化所述初始CFRE模型的损失函数来优化模型中的参数,得到初始持续小样本关系抽取模型;根据对比学习和知识蒸馏方法对所述初始持续小样本关系抽取模型进行优化,得到持续学习下小样本关系抽取模型;利用所述持续学习下小样本关系抽取模型进行关系抽取。
2.根据权利要求1所述的方法,其特征在于,对任务中的句子进行信息增强,得到增强后的句子,包括:对任务中的句子进行信息增强,得到增强后的句子为x aug ={w 1 ,...,[E 11 ],e 1 ,[E 12 ],...,[E 21 ],e 2 ,[E 22 ],...,w x }其中,w x 表示句子中的单词,[E11]、[E12]、[E21]和[E22]均表示特殊标记,e 1 和e 2 表示句中的头实体和尾实体。
3.根据权利要求2所述的方法,其特征在于,根据预先构建的模板映射函数对所述增强后的句子进行映射,得到基于提示的数据,包括:根据预先构建的模板映射函数对所述增强后的句子进行映射,得到基于提示的数据为x prompi =T(x aug )=I think e 1 is[MASK]of e 2 [SEP]x aug其中,T(·)表示模板映射函数,[MASK]表示任务位置,[SEP]表示句子分隔符。
4.根据权利要求3所述的方法,其特征在于,所述初始CFRE模型的总损失函数包括交叉熵损失函数、句子特征混合损失函数和对比损失函数;在每个任务中根据所述标签集上的概率分布、隐藏表示、规范化嵌入表示和数据增强策略构建初始CFRE模型的总损失函数,包括:根据所述标签集上的概率分布构建交叉熵损失函数;根据数据增强策略对所述隐藏表示和所述隐藏表示对应的类标签进行线性插值计算,得到插值结果;利用所述插值结果构建句子特征混合损失函数;根据规范化嵌入表示构建对比损失函数;利用所述交叉熵损失函数、句子特征混合损失函数和对比损失函数构建所述初始CFRE模型的总损失函数为L All =α 1 ·L CE +α 2 ·L SM +α 3 ·L CL其中,L CE 表示交叉熵损失函数,L SM 表示句子特征混合损失函数,L CL 表示对比损失函数,α 1 、α 2 、α 3 均表示调优参数。
5.根据权利要求4所述的方法,其特征在于,根据所述标签集上的概率分布构建交叉熵损失函数,包括:根据所述标签集上的概率分布构建交叉熵损失函数为其中,Θ表示初始CFRE模型, 表示训练数据集,k表示任务序号,P(y=y i ∣z i ,y i )表示标签集上的概率分布,y表示目标标签词,yi表示样本i在训练数据集里的真实标签,z i 表示规范化嵌入表示,i表示样本序号。
6.根据权利要求5所述的方法,其特征在于,利用所述插值结果构建句子特征混合损失函数,包括:利用所述插值结果构建句子特征混合损失函数为其中,v i 表示经过BERT得到的不同词的表示, 表示隐藏表示, 表示经过基于提示的编码器获得的混合句子特征, 表示混合句子特征对于的混合标签,表示正确的词表示。
7.根据权利要求6所述的方法,其特征在于,根据规范化嵌入表示构建对比损失函数,包括:根据规范化嵌入表示构建对比损失函数为其中,n表示 训练数据集的样本总数,P(i)表示与训练样本x i 关系相同的样本集合,|P(i)|表示P(i)的基数,p表示是与训练样本x i 具有关系相同的样本,S I 表示记忆内存中部分样本的集合,z i 表示规范化嵌入表示,z p 表示与训练样本x i 具有关系相同的样本表示,τ表示温度系数。
8.根据权利要求1所述的方法,其特征在于,根据对比学习和知识蒸馏方法对所述初始持续小样本关系抽取模型进行优化之前,还包括:根据所述规范化嵌入表示初始化所有任务的记忆内存,在所述记忆内存中利用k-means方法获得所述训练数据集中每个关系训练样本的聚类嵌入,根据所述聚类嵌入选择记忆内存的典型样本并保存。
9.根据权利要求8所述的方法,其特征在于,根据对比学习和知识蒸馏方法对所述初始持续小样本关系抽取模型进行优化,得到持续学习下小样本关系抽取模型,包括:根据知识蒸馏方法保留上一个任务中典型样本和对应关系原型之间的相似性,和典型样本与其他关系原型之间的不相似性,对每个样本和上一个任务中所有关系原型之间的相似度和不相似度之间的一致性进行计算,利用计算结果和预先设置的对比学习损失函数对所述初始持续小样本关系抽取模型进行优化,得到持续小样本关系抽取模型。
10.根据权利要求9所述的方法,其特征在于,对每个样本和上一个任务中所有关系原型之间的相似度和不相似度之间的一致性进行计算,包括:对每个样本和上一个任务中所有关系原型之间的相似度和不相似度之间的一致性进行计算,得到计算结果为其中, 是训练新任务前样本与其他关系原型之间相似度的度量分布, 表示前k个任务中出现的所有关系的集合, 表示训练新任务前原型i和关系原型j相似度的计算, 是训练新任务后样本与其他关系原型之间相似度的度量分布, 表示训练新任务后原型i和关系原型j相似度的计算, 由动态嵌入计算出的样本z i 和关系原型p j 之间的余弦相似度,τ表示温度系数。