文件名称:Yard中文分词系统V0.1.1版
文件大小:1.24MB
文件格式:RAR
更新时间:2012-07-05 19:35:19
中文分词 词典 词频 词性
Yard中文分词系统采用改进了的正向最大匹配算法,利用双字哈希进行词典组织解决了中文分词中最长词带来的分词效率低下问题。 本次发布的版本为0.1.1版能对中文词组进行完美的切分同时利用词组的词频和词性解决了歧义划分的问题,但是对人名、地名、组织名、英文、数字等还不能进行很好的切分,在下一个版本中将解决这些问题。中文词典应用了搜狗实验室提供的互联网词库。纯java编写源码和词典在附件中可以下载。本软件为开源软件你可以进行任何修改以适应你的需求,如果你加入了新功能请发送一份副本给我,我们一同完善改进。 分词精度为多少?朋友们自己去测试吧不会让你失望的!!
【文件预览】:
Yard0.1.1
----bin()
--------net()
----yard.bat(60B)
----data()
--------SogouLabDic.dic(2.82MB)