论文研究-中文短文本去重方法研究.pdf

时间:2022-09-30 08:11:48
【文件属性】:

文件名称:论文研究-中文短文本去重方法研究.pdf

文件大小:619KB

文件格式:PDF

更新时间:2022-09-30 08:11:48

论文研究

针对中文短文本冗余问题,提出了有效的去重算法框架。考虑到短文本海量性和简短性的特点,以及中文与英文之间的区别,引入了Bloom Filter、Trie树以及SimHash算法。算法框架的第一阶段由Bloom Filter或Trie树进行完全去重,第二阶段由SimHash算法进行相似去重。设计了该算法框架的各项参数,并通过仿真实验证实了该算法框架的可行性及合理性。


网友评论