论文研究-基于文本块密度和标签路径覆盖率的网页正文抽取.pdf

时间:2022-08-11 13:53:53
【文件属性】:

文件名称:论文研究-基于文本块密度和标签路径覆盖率的网页正文抽取.pdf

文件大小:2.21MB

文件格式:PDF

更新时间:2022-08-11 13:53:53

正文抽取,文本块密度,标签路径覆盖率,特征融合

大多数网页除了正文信息外,还包括导航、广告和免责声明等噪声信息。为了提高网页正文抽取的准确性,提出了一种基于文本块密度和标签路径覆盖率的抽取方法(CETD-TPC)。结合网页文本块密度特征和标签路径特征的优点,设计了融合两种特征的新特征,利用新特征抽取网页中的最佳文本块,最后,抽取该文本块中的正文内容。该方法有效地解决了网页正文中噪声块信息过滤和短文本难以抽取的问题,且无须训练和人工处理。在CleanEval数据集和从知名网站上随机选取的新闻网页数据集上的实验结果表明,CETD-TPC方法在不同数据源上均具有很好的适用性,抽取性能优于CETR、CETD和CEPR算法。


网友评论