在审
一种含中文人名纠错的中文文本纠错协同方法及系统
摘要
本发明公开了一种含中文人名纠错的中文文本纠错协同方法及系统,涉及自然语言处理技术领域。方法包括:构建同音、近音、形近混淆集;输入目标人名实体,基于混淆集生成人名纠错专属数据集;使用该数据集对中文文本纠错模型迭代训练,得到中文人名纠错模型;将待纠错文本输入模型,输出同时纠正人名与非人名错误的文本。本发明采用单阶段端到端架构,避免误差累积,专属数据集不依赖特定领域数据,跨领域泛化能力强,可统一处理两类错误,提升纠错效率与精度,适用于OCR、语音转写、文本校对等多种场景。
暂无引用专利




