基于网络资源与用户行为信息的领域术语提取

被引:9
作者
闫兴龙 [1 ,2 ,3 ,4 ]
刘奕群 [1 ,2 ,3 ]
方奇 [1 ,2 ,3 ]
张敏 [1 ,2 ,3 ]
马少平 [1 ,2 ,3 ]
茹立云 [1 ,2 ,3 ]
机构
[1] 智能技术与系统国家重点实验室(清华大学)
[2] 清华大学信息科学与技术国家实验室
[3] 清华大学计算机科学与技术系
[4] 总参陆航研究所
基金
高等学校博士学科点专项科研基金;
关键词
领域术语自动抽取; 新词发现; Web数据挖掘; 用户行为分析;
D O I
暂无
中图分类号
TP391.1 [文字信息处理];
学科分类号
081203 ; 0835 ;
摘要
领域术语是反映领域特征的词语.领域术语自动抽取是自然语言处理中的一项重要任务,可以应用在领域本体抽取、专业搜索、文本分类、类语言建模等诸多研究领域,利用互联网上大规模的特定领域语料来构建领域词典成为一项既有挑战性又有实际价值的工作.当前,领域术语提取工作所利用的网络语料主要是网页对应的正文,但是由于网页正文信息抽取所面临的难题会影响领域术语抽取的效果,那么利用网页的锚文本和查询文本替代网页正文进行领域术语抽取,则可以避免网页正文信息抽取所面临的难题.针对锚文本和查询文本所存在的文本长度过短、语义信息不足等缺点,提出一种适用于各种类型网络数据及网络用户行为数据的领域数据提取方法,并使用该方法基于提取到的网页正文数据、网页锚文本数据、用户查询信息数据、用户浏览信息数据等开展了领域术语提取工作,重点考察不同类型网络资源和用户行为信息对领域术语提取工作的效果差异.在海量规模真实网络数据上的实验结果表明,基于用户查询信息和用户浏览过的锚文本信息比基于网页正文提取技术得到的正文取得了更好的领域术语提取效果.
引用
收藏
页码:2089 / 2100
页数:12
相关论文
共 3 条
[1]   领域术语自动抽取及其在文本分类中的应用 [J].
刘桃 ;
刘秉权 ;
徐志明 ;
王晓龙 .
电子学报, 2007, (02) :328-332
[2]  
网页正文提取及去重技术研究[D]. 胡金栋.浙江大学 2011
[3]  
A statistical corpus-based term extractor. Patrick Pantel,Dekang Lin. Proceedings of AI . 2001