有效

一种用于互联网文本信息的噪声过滤和自动分类方法

张翀、何春辉、谭真、葛斌
中国人民解放军国防科技大学

摘要

本申请涉及一种用于互联网文本信息的噪声过滤和自动分类方法。所述方法包括:构建互联网文本信息的噪声过滤和自动分类模型,包括噪声检测模块、噪声过滤模块和自动分类模块。将获取到的互联网文本信息输入噪声检测模块,检测到包含噪声时将其输入噪声过滤模块,根据文本对象间的语义相似度值进行过滤,输出不包含噪声的互联网文本信息。使用不包含噪声的互联网文本信息训练和测试自动分类模块,使用训练好的模型获得互联网文本信息分类结果。采用本方法能同时实现文本噪声过滤和分类,避免噪声检测和过滤过分依赖特征选取的问题,及其对训练数据集质量要求较高的问题,还能消除噪声信息对文本分类结果的影响,提高文本分类结果的准确性。