失效

基于属性重现和标签路径的网页抽取方法

尹刚、王怀民、李翔、朱沿旭、史殿习、王涛、袁霖、余跃
中国人民解放军国防科学技术大学

摘要

一种基于属性重现和标签路径的网页抽取方法,包括:通过抽取目标网站或的属性值列表页面,构建属性值种子集合,其中包含了目标属性的部分取值;获取部分样本页面,确定各属性在属性名和值之间的相对标签路径;下载部分网页构建训练样本库,将获取的代码存放到本地数据库;查找并标注每一个种子属性值在训练网页中的所有重现,记录每次重现对应的标签路径;以对同一属性网页支持度最高的标签路径,作为抽取训练样本外其它网页信息的抽取规则;用所获取的标签路径,访问目标网站中的其他网页HTML树,定位属性值所在标签,抽取文本字符串;删除没有属性名或拥有错误属性名的属性值,将正确属性值存储到本地数据库,从而完成对页面属性的属性值抽取。

暂无引用专利