System.ArgumentOutOfRangeException: 索引和长度必须引用该字符串内的位置。 参数名: length 在 System.String.Substring(Int32 startIndex, Int32 length) 在 zhuanliShow.Bind() 文本审核方法、装置、电子设备及可读存储介质制造方法及图纸_技高网

文本审核方法、装置、电子设备及可读存储介质制造方法及图纸

技术编号:41209654 阅读:3 留言:0更新日期:2024-05-09 23:31
本发明专利技术实施例提供了一种文本审核方法、装置、电子设备及可读存储介质,该方法包括:获取待识别文本;所述待识别文本是通过第一滑动窗口从待处理文本中截取的;基于文本分段模型,确定所述待识别文本中的分段点;根据所述分段点,对所述待处理文本进行分段,得到多个第一分段文本;基于分类模型对所述第一分段文本进行识别,得到第一分类标注;根据所述第一分类标注,获取所述待识别文本的审核结果,从而通过确定文本的分段点,准确对待识别文本进行分段,避免待识别文本过长,导致难以进行识别的情况,本申请分别确定各个分段的第一分类标注,然后基于多个第一分类标注共同确定待识别文本的审核结果,从而准确对长文本进行审核。

【技术实现步骤摘要】

本专利技术属于文本处理领域,特别是涉及一种文本审核方法、装置、电子设备及可读存储介质


技术介绍

1、伴随着科技发展,数据正以爆炸式的速度增长,不同平台或产品为用户提供了海量信息资源。

2、要想保证平台或产品持续、稳定的发展,企业除了加强价值观建设和人工审核之外,也要求内容审核和技术能力双重的提升,才能应对海量信息资源内容的各种不确定性。

3、长文本是内容审核的典型对象,且长文本拥有的字符数量往往较多,如何对长文本进行内容审核,成为迫切需要解决的问题。


技术实现思路

1、本专利技术提供一种文本审核方法、装置、电子设备及可读存储介质,以便解决能够准确、高效地完成对长文本的内容审核。

2、为了解决上述技术问题,本专利技术是这样实现的:

3、第一方面,本专利技术提供一种文本审核方法,所述方法包括:

4、获取待识别文本;所述待识别文本是通过第一滑动窗口从待处理文本中截取的;

5、基于文本分段模型,确定所述待识别文本中的分段点;

6、根据所述分段点,对所述待处理文本进行分段,得到多个第一分段文本;

7、基于分类模型对所述第一分段文本进行识别,得到第一分类标注;

8、根据所述第一分类标注,获取所述待识别文本的审核结果。

9、第二方面,本专利技术提供一种文本审核装置,所述装置包括:

10、获取模块,用于获取待识别文本;所述待识别文本是通过第一滑动窗口从待处理文本中截取的;

11、确定模块,用于基于文本分段模型,确定所述待识别文本中的分段点;

12、分段模块,用于根据所述分段点,对所述待处理文本进行分段,得到多个第一分段文本;

13、第一标注模块,用于基于分类模型对所述第一分段文本进行识别,得到第一分类标注;

14、审核模块,用于根据所述第一分类标注,获取所述待识别文本的审核结果。

15、第三方面,本专利技术提供一种电子设备,包括:处理器、存储器以及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现上述文本审核方法。

16、第四方面,本专利技术提供一种可读存储介质,当所述存储介质中的指令由电子设备的处理器执行时,使得电子设备能够执行上述文本审核方法

17、在本专利技术实施例中,获取待识别文本;基于文本分段模型,确定所述待识别文本中的分段点;根据所述分段点,对所述待处理文本进行分段,得到多个第一分段文本;基于分类模型对所述第一分段文本进行识别,得到第一分类标注;根据所述第一分类标注,获取所述待识别文本的审核结果。本专利技术实施例,当待处理文本是长文本时,通过确定待处理文本的分段点,准确对待处理文本进行分段,然后分别确定各个分段的第一分类标注,然后基于多个第一分类标注共同确定待处理文本的审核结果,从而准确对长文本进行审核,避免待识别文本过长,内容多,导致对长文本或文档审核效果不好等问题。

本文档来自技高网...

【技术保护点】

1.一种文本审核方法,其特征在于,包括:

2.根据权利要求1所述的方法,其特征在于,所述基于文本分段模型,确定所述待识别文本中的分段点,包括:

3.根据权利要求2所述的方法,其特征在于,所述将所述第一数字序列输入至所述文本分段模型,得到所述待识别文本中的分段点,包括:

4.根据权利要求1所述的方法,其特征在于,所述根据所述分段点,对所述待识别文本进行分段,得到多个第一分段文本,包括:

5.根据权利要求4所述的方法,其特征在于,所述根据预设的窗口大小,对多个所述第二分段文本进行调整,得到第一分段文本,包括:

6.根据权利要求5所述的方法,其特征在于,所述根据所述第二分段文本中的标点符号,对所述第二分段文本进行分段,得到第四分段文本,包括:

7.根据权利要求1所述的方法,其特征在于,所述基于分类模型对所述第一分段文本进行识别,得到第一分类标注,包括:

8.一种文本审核装置,其特征在于,所述装置包括:

9.一种电子设备,其特征在于,包括:

10.一种可读存储介质,其特征在于,当所述存储介质中的指令由电子设备的处理器执行时,使得电子设备能够执行权利要求1-7中任一项所述的文本审核方法。

...

【技术特征摘要】

1.一种文本审核方法,其特征在于,包括:

2.根据权利要求1所述的方法,其特征在于,所述基于文本分段模型,确定所述待识别文本中的分段点,包括:

3.根据权利要求2所述的方法,其特征在于,所述将所述第一数字序列输入至所述文本分段模型,得到所述待识别文本中的分段点,包括:

4.根据权利要求1所述的方法,其特征在于,所述根据所述分段点,对所述待识别文本进行分段,得到多个第一分段文本,包括:

5.根据权利要求4所述的方法,其特征在于,所述根据预设的窗口大小,对多个所述第二分段文本进行调整,得到第一分段文本...

【专利技术属性】
技术研发人员:杨春阳邢启洲李健陈明武卫东
申请(专利权)人:北京捷通华声科技股份有限公司
类型:发明
国别省市:

网友询问留言 已有0条评论
  • 还没有人留言评论。发表了对其他浏览者有用的留言会获得科技券。

1