1.一种基于中文文本分类的情报快速整编方法,其特征在于,包括以下步骤:获取情报中的中文文本,将每个字符 转换为向量 ,将每个输入词 训练得到 维向量,对于具有多重感觉的字符和单词,通过共同学习词语和感觉来获得多重感觉嵌入;利用字符意义LSTM单元来融合字符的多种字符意义、利用单词意义LSTM单元来融合单词的多种单词意义以及利用融合LSTM单元来融合字符级和单词级特征,获得双向隐藏向量序列 ;将所述双向隐藏向量序列馈送到多维度注意力模块以产生多维度特征向量,获得最终表示 ;将所述最终表示 传输到完全连接层中以计算每种类型的置信度得分;以信息增益为目标函数,通过迭代优化模型中的所有参数直至收敛,以最小化损失函数;对分类后的情报文本根据用户需要的内容和格式进行组织,生成用户需要的情报产品,所述情报产品包括:对获取的文本进行参数整编或专项分析服务;所述将每个字符 转换为向量 的步骤如下:给定一个由 个字符组成的句子 ,通过查找预先训练的嵌入表,将每个字符 通过下式映射到具有相应的字母组合嵌入的向量表示中: ,其中 表示字符嵌入表, 代表字符的词汇量, 表示字符 的 unigram 嵌入;所述将每个输入词 训练得到 维向量的步骤如下:对应输入句子的单词序列 ,每个单词 通过下式捕获单词的语义和句法信息: ,其中, 是词汇表为 的单词嵌入表,句子的向量表示为 ;所述通过共同学习词语和感觉来获得多重感觉嵌入的步骤如下: ; ;其中 代表意义嵌入表, 是词汇量, 是 的意义嵌入, 是 的意义嵌入, 代表了第 个字符的意义;利用字符意义LSTM单元来融合字符的多种字符意义的步骤包括通过以下公式计算 第 个意义的单元门 : ; ;其中 代表字符 的意义嵌入, 是字符 的前向隐表示, 表示 的单元状态, 和 和 是训练参数, , , 分别代表了输入门,遗忘门和字符 的字符级特征, 与 分别表示sigmoid和双曲正切函数;所述利用单词意义LSTM单元来融合单词的多种单词意义的步骤包括:通过一个附加的LSTM单元获得单词 的第 j 个意义的单元门 : ; ;其中, 是单词 的第 个意义的嵌入, 和 是字符 的正向隐藏向量和单元状态;通过以下方式计算 的单元状态: ;其中 , 和 如下定义: ; ; ; , 和 分别代表了单词 、字符 和句子 的各个意义层级的单元状态, 是字符 的输入门, 和 由控制单词意义和字符意义的附加门生成, 代表了单词 的第 个意义的嵌入结合附加的单词意义门后的特征表示;所述最终表示 通过如下公式计算: ; ;其中 表示可训练的参数, 是所述双向隐藏向量的维数, 为所述双向隐藏向量序列中的元素, 为所述双向隐藏向量序列中元素个数;给定训练集 ,所述信息增益定义为: ;其中 表示模型中使用的所有参数, 为真实分布概率,Q为理论分布概率。
2.根据权利要求1所述的基于中文文本分类的情报快速整编方法,其特征在于,所述获得双向隐藏向量序列 的步骤如下: ,其中 和 是每个输入字符 的前向隐藏表示和后向隐藏表示。
3.根据权利要求1所述的用于情报快速整编的中文文本分类方法,其特征在于,所述置信度得分定义如下: ,其中 表示可学习的转换矩阵, 表示偏向向量, 是文本种类的数量。
4.根据权利要求1所述的基于中文文本分类的情报快速整编方法,其特征在于,利用随机梯度下降优化器通过迭代优化 直至收敛,以最小化损失函数。