有效

一种基于中文文本分类的情报快速整编方法

赵翔、郭爱博、谭真、庞宁、陈盈果、马武彬、肖卫东
中国人民解放军国防科技大学

摘要

本发明公开了一种基于中文文本分类的情报快速整编方法,包括将每个字符和输入词转换为向量,对于具有多重感觉的字符和单词,通过共同学习词语和感觉来获得多重感觉嵌入;利用三个LSTM单元来融合多种字符意义、多种单词意义以及字符级和单词级特征,获得双向隐藏向量序列,并馈送到多维度注意力模块以产生多维度特征向量,将最终表示传输到完全连接层中以计算每种类型的置信度得分;以信息增益为目标函数,迭代优化模型中的参数直至收敛;生成用户情报产品。在三个中文文本分类基准数据集上,本发明取得了超越基线的优异分类准确率,有效解决了中文分词的歧义性带来的负面影响,运行简单高效,模型复杂性远低于BERT类模型。