有效

标注语料生成方法、装置、设备及存储介质

冯大为、杨森、李东升
中国人民解放军国防科技大学

摘要

本申请公开了一种标注语料生成方法、装置、设备及存储介质,从原始数据集中获取标注样本作为语料模板,所述原始数据集中包括多个标注样本,每个标注样本中包括不同类型的元素和修饰词,对所述语料模板中的每一个元素,根据相似度获取与其类型相同的其它元素并进行替换,得到元素替换后的语料模板,对元素替换后的语料模板中的修饰词,利用微调后的预训练语言模型进行修改,修改完成后形成一个新的标注样本,其中,所述微调后的预训练语言模型是在原始数据集上使用遮盖语言模型任务微调预训练语言模型后得到的,从而有效生成大批量的用于训练信息抽取模型的标注数据,提升了信息抽取模型的泛化能力。