1.一种用于情报快速整编的中文文本分类方法,其特征在于,包括以下步骤:获取情报中的中文文本,将每个字符c i 转换为向量x i ,将每个输入词w i 训练得到d w 维向量,对于具有多重感觉的字符和单词,通过共同学习词语和感觉来获得多重感觉嵌入;利用字符意义LSTM单元来融合字符的多种字符意义、利用单词意义LSTM单元来融合单词的多种单词意义以及利用融合LSTM单元来融合字符级和单词级特征,获得双向隐藏向量序列{h 1 ,h 2 ,...,h m };将所述双向隐藏向量序列馈送到字符级注意模块以产生句子级特征向量,获得最终表示g;将所述最终表示g传输到完全连接层中以计算每种类型的置信度得分;以交叉熵损失为目标函数,通过迭代优化模型中的所有参数直至收敛,以最小化损失函数;对分类后的情报文本根据用户需要的内容和格式进行组织,生成用户需要的情报产品;其中,所述将每个字符c i 转换为向量x i 的步骤如下:给定一个由m个字符组成的句子s={c 1 ,c 2 ,...,c m },通过查找预先训练的嵌入表,将每个字符c i 通过下式映射到具有相应的字母组合嵌入的向量表示中:x i =E c (c i ),其中 表示字符嵌入表,|V c |代表字符的词汇量, 表示字符c i 的unigram 嵌入;所述将每个输入词w i 训练得到d w 维向量的步骤如下:对应输入句子的单词序列s={w 1 ,w 2 ,...,w n },每个单词w i 通过下式捕获单词的语义和句法信息:w i =E w (w i ),其中, 是词汇表为|V w |的单词嵌入表,句子的向量表示为{w 1 ,w 2 ,...,w n };所述通过共同学习词语和感觉来获得多重感觉嵌入的步骤如下:其中 代表意义嵌入表,|V sen |是词汇量, 是 的意义嵌入,代表了第j个字符的意义。
2.根据权利要求1所述的用于情报快速整编的中文文本分类方法,其特征在于,利用字符意义LSTM单元来融合字符的多种字符意义的步骤包括通过以下公式计算c i 第j个意义的单元的门:其中 代表字符c i 的意义嵌入, 是字符c i-1 的前向隐表示, 表示c i-1 的单元状态, 和 和b c 是训练参数, 分别代表了输入门,遗忘门和字符c i 的字符级特征,σ(·)表示sigmoid函数。
3.根据权利要求1所述的用于情报快速整编的中文文本分类方法,其特征在于,所述利用单词意义LSTM单元来融合单词的多种单词意义的步骤包括:通过一个附加的LSTM单元获得单词w b,e 的第j个意义的单元门:其中, 是单词w b,e 的第j个意义的嵌入, 和 是字符c b-1 的正向隐藏向量和单元状态;通过以下方式计算c i 的单元状态:其中 和 如下定义: 和 分别代表了单词w b,e 、字符c i 和句子c的各个意义层级的单元状态, 是字符c i 的输入门, 和 由控制单词意义和字符意义的附加门生成, 代表了单词w b,e 的第j个意义的嵌入结合附加的单词意义门后的特征表示。
4.根据权利要求1所述的用于情报快速整编的中文文本分类方法,其特征在于,所述获得双向隐藏向量序列{h 1 ,h 2 ,...,h m }的步骤如下:其中 和 是每个输入字符c i 的前向隐藏表示和后向隐藏表。
5.根据权利要求1所述的用于情报快速整编的中文文本分类方法,其特征在于,所述最终表示g通过如下公式计算:其中 表示可训练的参数,d h 是所述双向隐藏向量的维数,h i 为所述双向隐藏向量序列中的元素,m为所述双向隐藏向量序列中元素个数。
6.根据权利要求1所述的用于情报快速整编的中文文本分类方法,其特征在于,所述置信度得分定义如下:o=W o g+b o其中 表示可学习的转换矩阵, 表示偏向向量,K是文本种类的数量。
7.根据权利要求1所述的用于情报快速整编的中文文本分类方法,其特征在于,给定训练集T={(s i ,y i )},所述交叉熵损失定义为:其中Θ表示模型中使用的所有参数,P为计算得到的概率。
8.根据权利要求7所述的用于情报快速整编的中文文本分类方法,其特征在于,利用随机梯度下降优化器通过迭代优化Θ直至收敛,以最小化损失函数。