有效
关联计算的预处理方法及装置
摘要
本发明提供一种关联计算的预处理方法及装置,该方法在对文本分词的基础上,使用LDA模型算法对文本进行主题聚类计算得到文档‑主题概率分布以及主题‑词概率分布。然后通过文档‑主题概率分布计算出文本的非相关主题集合,通过主题‑词概率分布计算出文本的非相关词,从而将与文档主题内容不相关的词识别提取出来。将过滤结果用于进一步的关联计算。从而降低了非相关词对关联计算的干扰。
本发明提供一种关联计算的预处理方法及装置,该方法在对文本分词的基础上,使用LDA模型算法对文本进行主题聚类计算得到文档‑主题概率分布以及主题‑词概率分布。然后通过文档‑主题概率分布计算出文本的非相关主题集合,通过主题‑词概率分布计算出文本的非相关词,从而将与文档主题内容不相关的词识别提取出来。将过滤结果用于进一步的关联计算。从而降低了非相关词对关联计算的干扰。