1.一种用于少样本意图识别的对比任务适应学习方法,其特征在于,包括如下步骤:S1:获取一个有 个语句-标签对的意图识别数据集D;其中 表示一条语句, 表示它的意图标签集合中的一个,即 ;S2:从意图识别数据集D抽取元任务集合 ;将所述的数据集D划分为用于训练的基本类和用于测试的新类,基本类形成的训练集合与新类形成的测试类集合之间不存在交集;由此分别构建: ,用于训练; ,用于测试;其中, 为一个元任务,由一个支撑集和一个查询集两部分组成,表示为其中, 为支撑集,是一个有 个语句-标签对的集合; 为查询集,是一个有 个语句-标签对的集合;标签 是需要被预测的; 含有 个类别的意图标签,每个标签含有 个意图样本, ;S3:从集合 中的第j个元任务 中的 句子获取低维向量 ;采用BERT模型用作一个特征抽取器,从 中的 句子进行编码为一个连续的低维向量 ; 为集合 中的第j个元任务;S4:计算特征抽取器的对比损失;记 为类别 的中心,则 (3)其中, 表示类别 中的语句 ,由此同类别中的样本能够有到中心的最短距离;记 是衡量两个样本之间相似度的评分函数,则 (5)其中 表示和 在同类别中的样本, 表示和 不同类别的样本;损失函数可构建为: (8)其中 是常数;S5:从支撑集 中获取原型嵌入集合 ;引入一个特定任务的函数T,抽取每一个元任务的独有信息:其中 是一个由公式(3)确定的支撑集 中的原型集合;原型集合 中的交互能够反映这个元任务的本质;S6:根据所述的原型嵌入集合 ,计算标签 的语义混合原型 ;S7:计算标签预测结果 ;S8:计算总损失 ;S9:计算梯度 ;S10:用梯度 更新特征抽取器 、特定任务的函数T;转入S2,直至对集合D中的每一组 进行了训练;S11:训练完成,返回最优分类器 ; 最优特征抽取器 。
2.根据权利要求1所述的用于少样本意图识别的对比任务适应学习方法,其特征在于,所述的步骤S6实现如下:将变换后的原型 记作类别 中样本嵌入的中心: (13)标签名称可作为先验知识,因为它本身就包含着类别的特有信息,因此直接将标签名称的嵌入作为每个类别的指引信息,通过标签名称和变换之后的样本嵌入来表示每个类别;对于标签 ,通过一个平衡系数 来调节标签名称和变换后嵌入的重要程度,以计算它的语义混合原型 : (14)其中 是BERT模型的编码器,标签名称的嵌入 是作为原型表示向量的一个修正量存在的和/或所述的步骤S7实现如下:记 (15)其中: 为查询集 中的语句 是基于混合语义原型来预测 标签的分类器, 是预测结果;和/或所述步骤S8实现如下:为保证适应后的样本嵌入和同类别的相似而与不同类别的不相似,引入另一个损失函数: (16)其中 是任务适应之后的 的嵌入, 是对应的真实标签的语义混合原型; 是损失函数; (17)其中 是一个平衡系数;转入S3,直至对集合 每一个元任务 进行了训练;和/或所述的步骤S11实现如下: (2)其中, 表示一个训练元任务中查询集所包含的一个语句-标签对; 表示分类器 利用从当前训练元任务支撑集 中学到的知识来预测出的结果; 是计算预测出的概率分布 和真实分布 之间差距的损失函数。
3.根据权利要求1所述的用于少样本意图识别的对比任务适应学习方法,其特征在于,步骤S5还包括:为避免原型之间顺序的影响,使用了多头自注意力模型来对每个元任务独有的信息建模:多头自注意力层的核心是形式为(查询 ,键 ,值 )的一组三元组,为获取每个初始原型在线性映射之后原型中所具有的权重,将三元组输入到一个线性映射层中来获取对应的表示 ,可用下式表示: (10)其中 , 和 是线性映射矩阵,[:]表示一个矩阵;最后按自注意力算法来获取原型 最终变换之后的原型嵌入:其中权重 度量了键与值的接近程度,也反映了原型 与其他原型之间的交互,按下式计算: (12)其中 表示 的第 列, 表示嵌入的维度;根据自注意力初始化的惯例,设置 ,来自支撑集 。
4.根据权利要求1所述的用于少样本意图识别的对比任务适应学习方法,其特征在于,步骤S1所述的意图识别数据集为OOS数据集。
5.根据权利要求4所述的用于少样本意图识别的对比任务适应学习方法,其特征在于,所述的意图识别数据集为OOS标记好类别的数据,不含有噪声标签out of scope的数据。
6.根据权利要求4所述的用于少样本意图识别的对比任务适应学习方法,其特征在于,所述的意图识别数据集,使用数据集2/3的样本作为训练集,以获取公共的知识,其余1/3的样本被平均划分为验证集和测试集。