基于改进BP网络的中文歧义字段分词方法研究 (2007年)

时间:2024-06-12 11:08:45
【文件属性】:

文件名称:基于改进BP网络的中文歧义字段分词方法研究 (2007年)

文件大小:919KB

文件格式:PDF

更新时间:2024-06-12 11:08:45

自然科学 论文

文本挖掘中中文歧义字段的自动分词是计算机科学面临的一个难题。针对汉语书写时按句连写,词间无间隙,歧义字段分词困难的特点,对典型歧义中所蕴含的语法现象进行了归纳总结,建立了供词性编码使用的词性代码库。以此为基础,通过对具有特殊语法规则的歧义字段中的字、词进行代码设定,转化为神经网络能够接受的输入向量表示形式,然后对样本进行训练,通过改进BP神经网络的自学习来掌握这些语法规则。训练结果表明:算法在歧义字段分词上达到了93.13%的训练精度和92.50%的测试精度。


网友评论