【技术实现步骤摘要】
一种网络负载均衡的多代理分布式爬虫系统和方法
本专利技术涉及一种网络负载均衡的多代理分布式爬虫系统和方法,属于互联网
技术介绍
随着互联网技术的发展,Web站点日益增多,伴随着分布式技术的迅猛发展,Web站点的部署已逐渐趋于多主机化,不仅仅在同一个物理位置区域。与此同时,为了保护自己的网站数据,反爬虫技术也日益加强,越来越多的反爬虫机制给爬虫系统造成的麻烦越来越多。因此,爬虫系统的爬取方式也从单点发展至分布式,以便更快速的爬取数据,此外,代理节点技术也是一个很好的抵御反爬虫技术的方式。但是在这个过程中,由于网络负载的问题、代理节点的可用性问题、代理节点的的工作效率问题,将导致爬虫任务的低效率。因此,亟待提供一种能够充分均衡网络负载的高效、稳定的分布式爬虫系统解决方案。
技术实现思路
本专利技术所要解决的技术问题是克服现有技术的缺陷,提供一种能够均衡网络负载、高效、稳定的分布式爬虫系统。为解决上述技术问题,本专利技术提供一种网络负载均衡的多代理分布式爬虫系统,包括多个代理节点,所述多个代理节点被配置为执行爬虫任务并返回爬行结果,其特征是,包括:数据计算模块,被 ...
【技术保护点】
1.一种网络负载均衡的多代理分布式爬虫系统,包括多个代理节点,所述多个代理节点被配置为执行爬虫任务并返回爬行结果,其特征是,包括:数据计算模块,被配置为计算任务的权重并根据计算结果筛选出新种子;中心控制模块,被配置为根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡;中心控制模块被进一步配置为:根据任务的权重、任务的特征、代理节点的负载情况计算节点的等待参数,然后将任务下发给等待参数最小的代理节点;代理节点获取模块,被配置为获取可被使用的代理节点并向代理节点提交新代理节点;代理节点监控模块,被配置为监控可用代理节点的生存状态及考核代理节点获取模块提交 ...
【技术特征摘要】
1.一种网络负载均衡的多代理分布式爬虫系统,包括多个代理节点,所述多个代理节点被配置为执行爬虫任务并返回爬行结果,其特征是,包括:数据计算模块,被配置为计算任务的权重并根据计算结果筛选出新种子;中心控制模块,被配置为根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡;中心控制模块被进一步配置为:根据任务的权重、任务的特征、代理节点的负载情况计算节点的等待参数,然后将任务下发给等待参数最小的代理节点;代理节点获取模块,被配置为获取可被使用的代理节点并向代理节点提交新代理节点;代理节点监控模块,被配置为监控可用代理节点的生存状态及考核代理节点获取模块提交的新代理节点的可用性。2.根据权利要求1所述的分布式爬虫系统,其特征是:所述中心控制模块,被进一步配置为:用于管理员对系统进行控制,其中系统控制包括启动系统、关闭系统、注入初始种子、请求新可用代理节点、维护节点池、存储代理节点的状态信息、向代理节点监控模块发出节点监控命令以及选择代理节点并分配任务给代理节点。3.根据权利要求2所述的分布式爬虫系统,其特征是,还包括:所述中心控制模块与代理节点监控模块被配置为配合完成监控所有当前存活的代理节点的任务;进一步地,中心控制模块被配置为在监控间隔时间范围内随机向代理节点监控模块发出监控命令,代理节点监控模块将在接收命令后,对指定代理节点进行监控;所述代理节点监控模块,被配置为将代理节点的状态信息提交给中心控制模块;进一步地,还被配置为监控代理节点获取模块所提交的新代理节点,若返回时间小于允许最大返回值,则视为可用,代理节点监控模块将此新代理节点的状态信息提交给中心控制模块,中心控制模块将更新该节点的状态信息,否则将丢弃。4.一种网络负载均衡的多代理分布式爬虫方法,其特征在于,包括:计算任务的权重并根据计算结果筛选出新种子;根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡。5.根据权利要求4所述的分布式爬虫方法,其特征在于,计算任务的权...
还没有人留言评论。发表了对其他浏览者有用的留言会获得科技券。