一种网络信息的自动提取方法及装置制造方法及图纸

技术编号：8161617 阅读：353 留言：0更新日期：2013-01-07 19:35

本发明专利技术提供了一种网络信息的自动提取方法及装置，相应的方法包括从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W’；根据预定规则生成信息pattern集合P’，并将信息pattern集合P’与正则表达式集合P求合集获得集合P1；将集合P1与给定信息相关的网页合集W中的所有的网页进行匹配，获得集合Ssub’，直到Ssub==Ssub’时抓取过程结束。本发明专利技术通过根据不同的网页生成相应的正则表达式集合，实现自动提取网页中的内容，省去了很多工作量。

全部详细技术资料下载

【技术实现步骤摘要】

本专利技术涉及一种网络信息的自动提取方法及装置，属于网络信息提取

技术介绍
对于在网页上展现的信息，现有技术普遍通过正则表达式来描述，对于不同的网页，所对应的正则表达式往往是各不相同，这样就导致网络信息提取的工作量较大。
技术实现思路
本专利技术为解决现有的网络信息提取的工作量较大的问题，进而提供了一种网络信息的自动提取方法及装置。为此，本专利技术提供了如下的技术方案一种网络信息的自动提取方法，包括·从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W，；根据预定规则生成信息pattern集合P’,并将信息pattern集合P’与正则表达式集合P求合集获得集合P1 ;将集合P1与给定信息相关的网页合集W中的所有的网页进行匹配，获得集合Ssub ’,直到Ssub==Ssub'时抓取过程结束。一种网络信息的自动提取装置，包括网页选取单元，用于从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W，；集合选取单元,用于根据预定规则生成信息pattern集合P’,并将信息pattern集合P’与正则表达式集合P求合集获...

【技术保护点】
一种网络信息的自动提取方法，其特征在于，包括：从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W’；根据预定规则生成信息pattern集合P’，并将信息pattern集合P’与正则表达式集合P求合集获得集合P1；将集合P1与给定信息相关的网页合集W中的所有的网页进行匹配，获得集合Ssub’，直到Ssub==Ssub′时抓取过程结束。

【技术特征摘要】

【专利技术属性】
技术研发人员：杨俊拯，温予，张旸，黄百宁，王世平，葛猛，孟玲会，
申请(专利权)人：北京云泓道元信息技术有限公司，
类型：发明
国别省市：

全部详细技术资料下载我是这个专利的主人