【技术实现步骤摘要】
本专利技术涉及一种网络信息的自动提取方法及装置,属于网络信息提取
技术介绍
对于在网页上展现的信息,现有技术普遍通过正则表达式来描述,对于不同的网页,所对应的正则表达式往往是各不相同,这样就导致网络信息提取的工作量较大。
技术实现思路
本专利技术为解决现有的网络信息提取的工作量较大的问题,进而提供了一种网络信息的自动提取方法及装置。为此,本专利技术提供了如下的技术方案一种网络信息的自动提取方法,包括·从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W,;根据预定规则生成信息pattern集合P’,并将信息pattern集合P’与正则表达式集合P求合集获得集合P1 ;将集合P1与给定信息相关的网页合集W中的所有的网页进行匹配,获得集合Ssub ’,直到Ssub==Ssub'时抓取过程结束。一种网络信息的自动提取装置,包括网页选取单元,用于从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W,;集合选取单元,用于根据预定规则生成信息pattern集合P’,并将信息pattern集合P’与正则表达式集合P求合集获 ...
【技术保护点】
一种网络信息的自动提取方法,其特征在于,包括:从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W’;根据预定规则生成信息pattern集合P’,并将信息pattern集合P’与正则表达式集合P求合集获得集合P1;将集合P1与给定信息相关的网页合集W中的所有的网页进行匹配,获得集合Ssub’,直到Ssub==Ssub′时抓取过程结束。
【技术特征摘要】
【专利技术属性】
技术研发人员:杨俊拯,温予,张旸,黄百宁,王世平,葛猛,孟玲会,
申请(专利权)人:北京云泓道元信息技术有限公司,
类型:发明
国别省市:
还没有人留言评论。发表了对其他浏览者有用的留言会获得科技券。