在审
一种基于K-means++的专业领域敏感实体知识库构建方法
摘要
本发明涉及敏感信息处理技术领域,尤其涉及一种基于K‑means++的专业领域敏感实体知识库构建方法。本发明包括如下步骤:步骤1、获取专业领域的电子文本文件;步骤2、从所述电子文本文件抓取出纯文本信息;步骤3、对所述纯文本信息进行数据清洗;步骤4、抽取出组织机构类命名实体;步骤5、对抽取出的命名实体进行语义向量化表示;步骤6、通过K‑means++聚类模块对命名实体进行聚类,得到聚类结果信息;步骤7、开源搜集的敏感实体;步骤8、对聚类结果信息进行敏感实体类别的筛选与判定,与所述开源搜集的敏感实体进行归并加入数据库。本发明能够解决专业领域内敏感实体识别困难和标注专业领域预料库时缺乏领域词典的难题。
暂无引用专利



