基于后缀树模型的文本实时分类系统的研究和实现

时间:2012-03-14 11:01:08
【文件属性】:

文件名称:基于后缀树模型的文本实时分类系统的研究和实现

文件大小:223KB

文件格式:PDF

更新时间:2012-03-14 11:01:08

后缀树 文本 实时 分类

本文在面向网络内容分析的前提下,提出了一种基于后缀树的文本向量空间模型(VSM),并在此 模型之上实现了文本分类系统。对比基于词的VSM,该模型利用后缀树的快速匹配,实时获得文本的向量 表示,不需要对文本进行分词、特征抽取等复杂计算。同时,该模型能够保证训练集中文本的更改,对分 类结果产生实时影响。实验结果和算法分析表明,我们系统的文本预处理的时间复杂度为O(N),远远优于 分词系统的预处理时间复杂度。此外,由于不需要分词和特征抽取,分类过程与具体语种无关,所以是一 种独立语种的分类方法


网友评论