共 8 条
一种引入动态词库更新的中文分词架构
被引:2
作者:
刘芳芳
王晶
沈奇威
机构:
[1] 北京邮电大学 网络与交换技术国家重点实验室
[2] 东信北邮信息技术有限公司
来源:
关键词:
中文分词;
最大词长;
歧义处理;
互信息;
未登录词;
D O I:
暂无
中图分类号:
TP391.1 [文字信息处理];
学科分类号:
081203 ;
0835 ;
摘要:
针对互联网环境下新词出现和更新频率高的特点,将机械分词与基于规则分词相结合,提出一种动态更新词库的中文分词架构.本架构给出了新的词典设计结构及歧义处理规则,并将统计学中的互信息概念运用到新词判定环节.实验表明本文提出的中文分词架构具有较高的准确率和良好的适应性.
引用
收藏
页码:100 / 103+50
+50
页数:5
相关论文

