1.一种文档检索方法,其特征在于,所述文档检索方法应用于在线排序模型,所述方法包括以下步骤:获取用户输入的检索词条的目标词串,并确定所述目标词串的语义重要度;获取与所述目标词串相匹配的候选文档,并确定所述目标词串与所述候选文档之间的相关度;根据所述语义重要度对所述相关度进行优化,获得优化后相关度;通过所述优化后相关度对所述候选文档进行排序后展示。
2.如权利要求1所述的文档检索方法,其特征在于,所述确定所述目标词串的语义重要度的步骤,包括:获取所述目标词串中各分词相对所述检索词条的原始词重要度;根据所述各分词的数量确定所述检索词条的分词后句子长度;基于所述分词后句子长度对所述原始词重要度进行优化,获得所述目标词串的语义重要度。
3.如权利要求2所述的文档检索方法,其特征在于,所述基于所述分词后句子长度对所述原始词重要度进行优化,获得所述目标词串的语义重要度的步骤,包括:通过预设词重要度优化公式基于所述分词后句子长度对所述原始词重要度进行统一化处理,获得所述目标词串的语义重要度,其中,所述预设词重要度优化公式为:W=Important(Sent)*len(Sent),式中,W为统一化词重要度,Important(C)为原始词重要度,len(Sent)为分词后句子长度。
4.如权利要求3所述的文档检索方法,其特征在于,所述根据所述语义重要度对所述相关度进行优化,获得优化后相关度的步骤,包括:通过预设相关度优化公式基于所述语义重要度对所述相关度进行优化,获得各分词的优化后分词相关度,其中,所述预设相关度优化公式为:S tw =W i *S i ,式中,S tw 为优化后分词相关度,W i 为目标词串中词语i的统一化词重要度,S i 为目标词串中词语i与候选文档的相关度;通过预设相关度叠加公式将所述各分词的优化后分词相关度进行叠加,获得所述目标词串的优化后相关度,其中,所述预设相关度叠加公式为:式中,R doc 为优化后相关度,S tw 为优化后分词相关度。
5.如权利要求1所述的文档检索方法,其特征在于,所述获取与所述目标词串相匹配的候选文档的步骤,包括:从预设倒排数据库中查询与所述目标词串中各分词匹配的匹配词串;基于所述匹配词串从预设正排数据库中并发查询与所述匹配词串相匹配的匹配文档;召回所述匹配文档,并将所述匹配文档作为与所述目标词串相匹配的候选文档。
6.如权利要求5所述的文档检索方法,其特征在于,所述获取与所述目标词串相匹配的候选文档的步骤之前,还包括:获取样本文档,并根据所述样本文档的格式选取对应的解析策略对所述样本文档进行解析,获得格式统一的解析后文档;采用多粒度的切词粒度对所述解析后文档的标题进行切词,获得倒排索引;基于所述倒排索引构建预设倒排数据库,并根据与所述倒排索引对应的目标样本文档构建预设正排数据库。
7.如权利要求1至6任一项所述的文档检索方法,其特征在于,所述在线排序模型的构建包括:获取由预设文档构成的初始数据,并根据所述预设文档中的预设行业关键词对所述初始数据进行标注,获得标注数据;通过所述标注数据对transformer模型进行训练,获得离线排序模型,其中,所述离线排序模型的输出结果为将transformer模型后两层输出结果合并后获得的单层结果;基于所述离线排序模型对预设未标注文档数据进行预测,获得所述预设未标注文档数据的样本相关度结果;根据所述样本相关度结果对XGBoost模型进行训练,获得在线排序模型。
8.一种文档检索装置,其特征在于,所述装置包括:语义重要度模块,用于获取用户输入的检索词条的目标词串,并确定所述目标词串的语义重要度;文档相关度模块,用于获取与所述目标词串相匹配的候选文档,并确定所述目标词串与所述候选文档之间的相关度;相关度优化模块,用于根据所述语义重要度对所述相关度进行优化,获得优化后相关度;候选文档展示模块,用于通过所述优化后相关度对所述候选文档进行排序后展示。
9.一种文档检索设备,其特征在于,所述设备包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的文档检索程序,所述文档检索程序配置为实现如权利要求1至7中任一项所述的文档检索方法的步骤。
10.一种存储介质,其特征在于,所述存储介质上存储有文档检索程序,所述文档检索程序被处理器执行时实现如权利要求1至7任一项所述的文档检索方法的步骤。