自动标引

✍ dations ◷ 2024-12-23 00:37:18 #图书资讯科学,信息检索,计算机科学,计算语言学,数据挖掘,中文信息检索

自动标引(英语:Automatic Indexing)包括关键词自动提取(又称自动抽词标引)与自动赋词标引两种类型。关键词自动提取是一种识别有意义且具有代表性片段或词汇的自动化技术。关键词自动提取在文本挖掘域被称为关键词抽取(英语:Keyword Extraction),在计算语言学领域通常着眼于术语自动识别(英语:Automatic Term Recognition),在讯息检索领域,就是指自动标引。自动标引属于文本讯息抽取的范畴。文本讯息抽取是从文本数据中抽取人们关注的特定的讯息。

由于关键词是表达文件主题意义的最小单位,因此大部分对非结构化文件的自动处理,如自动标引、自动文摘、自动分类、自动聚类、相关反馈、自动过滤、事件检测与跟踪、知识挖掘、信息可视化、概念检索、检索提示、关联知识分析、自动问答等,都必须先进行关键词提取的动作,再进行其他的处理。可以说,关键词提取是所有文件自动处理的基础与核心技术。目前大多文档都不具有关键词,同时手工标引费力费时且主观性较强, 因此关键词自动标引是一项值得研究的技术。

自动标引研究可以分为三个阶段:从Luhn于1957年开始进行自动标引后开始,到目前为止,自动标引研究经历了50年的发展历程。一直到20世纪90年代初,关于关键词自动提取的研究一直就没有停止过。 20世纪90年代初到90年代末,自动标引研究渐渐冷却,原因主要包括:全文索引逐渐被人采用,并且基本上能满足用户需要;传统的自动标引方法的效率到了极限;网络兴起之初的冲击与信息需求环境的改变。20世纪90年代末一直到现在,关键词自动提取的研究逐渐升温,尤其是最近几年,关键词自动提取研究进行的如火如荼,产生该现象的主要原因为:全文索引的功能越来越难以满足实际需求,用户需要更加精确的结果;另外互联网的很多服务,例如自动摘要,文档分类与聚类,文本分析,主题检索等都要依赖于关键词自动提取的结果,只有这样才能有希望从根本上提高讯息服务品质。

根据见诸于报道的自动标引研究情况,结合自动标引研究领域的影响程度和自动标引方法的创新程度,归纳出1957~2007年五十年时间里比较有代表性的自动标引方法。

相关

  • 欧亚大陆欧亚大陆或亚欧大陆是亚细亚洲大陆和欧罗巴洲大陆的合称。面积5473.8万平方公里。亚、欧二大陆单从地理学方面来归类应属同一个、地球表面面积最大的洲。亚洲与欧洲的分别主
  • 阿拉瓦克语系阿拉瓦克语系(Arawak),是南美洲和加勒比海的阿拉瓦克族的语言。牙买加的国名来自于此语,是“泉水之岛”的意思。
  • 代词代名词'在语言学和语法学中是指代替名词或名词短语的形式词(是否附加限定词各个语言不同),如中文的“你”、“我”、“他”,英文的 “pronoun”法语的“nous”、“elle”等。问
  • 运动心理学异常心理学 行为遗传学 生物心理学 心理药物学 认知心理学 比较心理学 跨文化心理学 文化心理学 差异心理学(英语:Differential psychology) 发展心理学 演化心理学 实验心理学
  • 周士渊周士渊(1983年11月16日-),生涯都效力于裕隆纳智捷篮球队,主要位置是得分后卫,因其罚球稳健出色,故有优质射手的头衔。高中时与吴永仁、李奇勋、庄晓文、田垒合称“三民五虎”。周士
  • 黄花夹竹桃属黄花夹竹桃属(学名:Thevetia)是夹竹桃科下的一个属,为灌木或小乔木植物。该属共有15种,分布于热带美洲和热带亚洲。
  • 麦哲伦海峡麦哲伦海峡(英语:Strait of Magellan;西班牙语:Estrecho de Magallanes)是位于南美洲智利南部的一个海峡,处在南侧的火地群岛和北侧的南美洲大陆之间。麦哲伦海峡较德雷克海峡平静
  • 杰西·罗布雷多杰西·罗布雷多(Jesse Manalastas Robredo,1958年5月27日-2012年8月18日),中文姓名林炳智,第二代菲律宾华人,由2010年起担任菲律宾贝尼格诺·亚基诺三世政府内政部长,直至逝世。2012
  • 美国东岸美国东岸,或称为大西洋海岸,是指美国的最东部的海岸地区,东向面临大西洋,北边为加拿大,南边为墨西哥湾。此区域通常包括以前北美十三个殖民地的范围,现在则由北到南包括缅因州、新
  • 安塔基亚安塔基亚(阿拉伯语:انطاكية‎(),来自希腊语:Ἀντιόχεια( 或),叙利亚语:ܐܢܛܝܘܟܝܐ())是土耳其哈塔伊省的一座城市,靠近叙利亚边境。古时称为安提阿,在基督教历史上占