在审

一种含中文人名纠错的中文文本纠错协同方法及系统

古晶、谢江宇、白雨松、冯幼恒、侯彪、毛莎莎、杨淑媛、刘芳、焦李成
西安电子科技大学

摘要

本发明公开了一种含中文人名纠错的中文文本纠错协同方法及系统,涉及自然语言处理技术领域。方法包括:构建同音、近音、形近混淆集;输入目标人名实体,基于混淆集生成人名纠错专属数据集;使用该数据集对中文文本纠错模型迭代训练,得到中文人名纠错模型;将待纠错文本输入模型,输出同时纠正人名与非人名错误的文本。本发明采用单阶段端到端架构,避免误差累积,专属数据集不依赖特定领域数据,跨领域泛化能力强,可统一处理两类错误,提升纠错效率与精度,适用于OCR、语音转写、文本校对等多种场景。

暂无引用专利