【技术实现步骤摘要】
【技术保护点】
一种自动抽取论坛数据的方法,包括下述步骤:a、识别主贴页面:对给定url的网页的进行抓取并根据网页结构进行聚类,找出帖子页面;b、条目定位:计算与帖子页面所在的类同一路径下的相似子树的个数的信息熵,其中熵的最大值的路径为条目在标签树中的路径;c、识别内容并生成抽取模版:根据条目可视字串建立特征向量,再根据特征向量划分数据集,最后区分可见词代表的意义并生成抽取模板;d、利用抽取模板抽取论坛数据。
【技术特征摘要】
【专利技术属性】
技术研发人员:郭成林,彭春林,刘红玉,高云棋,刘丹,
申请(专利权)人:宁波成电泰克电子信息技术发展有限公司,
类型:发明
国别省市:
还没有人留言评论。发表了对其他浏览者有用的留言会获得科技券。