自动标引

✍ dations ◷ 2025-07-19 16:07:18 #图书资讯科学,信息检索,计算机科学,计算语言学,数据挖掘,中文信息检索

自动标引(英语:Automatic Indexing)包括关键词自动提取(又称自动抽词标引)与自动赋词标引两种类型。关键词自动提取是一种识别有意义且具有代表性片段或词汇的自动化技术。关键词自动提取在文本挖掘域被称为关键词抽取(英语:Keyword Extraction),在计算语言学领域通常着眼于术语自动识别(英语:Automatic Term Recognition),在讯息检索领域,就是指自动标引。自动标引属于文本讯息抽取的范畴。文本讯息抽取是从文本数据中抽取人们关注的特定的讯息。

由于关键词是表达文件主题意义的最小单位,因此大部分对非结构化文件的自动处理,如自动标引、自动文摘、自动分类、自动聚类、相关反馈、自动过滤、事件检测与跟踪、知识挖掘、信息可视化、概念检索、检索提示、关联知识分析、自动问答等,都必须先进行关键词提取的动作,再进行其他的处理。可以说,关键词提取是所有文件自动处理的基础与核心技术。目前大多文档都不具有关键词,同时手工标引费力费时且主观性较强, 因此关键词自动标引是一项值得研究的技术。

自动标引研究可以分为三个阶段:从Luhn于1957年开始进行自动标引后开始,到目前为止,自动标引研究经历了50年的发展历程。一直到20世纪90年代初,关于关键词自动提取的研究一直就没有停止过。 20世纪90年代初到90年代末,自动标引研究渐渐冷却,原因主要包括:全文索引逐渐被人采用,并且基本上能满足用户需要;传统的自动标引方法的效率到了极限;网络兴起之初的冲击与信息需求环境的改变。20世纪90年代末一直到现在,关键词自动提取的研究逐渐升温,尤其是最近几年,关键词自动提取研究进行的如火如荼,产生该现象的主要原因为:全文索引的功能越来越难以满足实际需求,用户需要更加精确的结果;另外互联网的很多服务,例如自动摘要,文档分类与聚类,文本分析,主题检索等都要依赖于关键词自动提取的结果,只有这样才能有希望从根本上提高讯息服务品质。

根据见诸于报道的自动标引研究情况,结合自动标引研究领域的影响程度和自动标引方法的创新程度,归纳出1957~2007年五十年时间里比较有代表性的自动标引方法。

相关

  • 抽象释义在计算机科学中,抽象释义是基于在有序集合特别是格上的单调函数,计算机程序的语义的可靠逼近理论。它可以被看作对计算机程序的部分执行,获取关于它的语义信息(比如,控制结构、
  • 亚铁磁性在物理学中,亚铁磁性物质为不同亚晶格的原子磁矩呈相反的物质,如在反铁磁性中;然而,在亚铁磁性物质中,相反的磁矩不相等,存在自发磁化。该情况发生于,当亚晶格是由不同的材料或不同
  • 维生素D缺乏维生素D缺乏症是缺乏维生素D所表现出来的一系列病症。这种疾病可能是由于人体摄入的维生素D不足,并且没有接受足够多的阳光照射(准确地说是阳光中的中波紫外线B光)导致的,也有可
  • 突厥议会突厥议会(阿塞拜疆语:Türk Şurası;哈萨克语:Түркі кеңесі;吉尔吉斯语:Түрк кеңеш;土耳其语:Türk Keneşi)或全称突厥语国家合作委员会(英语:Cooperation Counc
  • 穆罕默德贾瓦德·巴霍纳尔穆罕默德贾瓦德·巴霍纳尔(波斯语:محمد جواد باهنر‎,1933年-1981年8月30日),曾任伊朗伊斯兰共和国第二任总理、伊斯兰共和党总书记。是伊朗执政党伊斯兰共和党创始
  • 捷克统计局捷克统计局(捷克语:Český statistický úřad),为捷克政府官方的统计机构。总部位于首都布拉格。该局的主要工作是搜集、分析、发布捷克的各项统计数据。捷克统计局的历史可
  • 威斯敏斯特威斯敏斯特 (英语:Westminster)是美国科罗拉多州的一座城市,位于州府丹佛西北14千米处。行政上分属杰佛逊县和亚当斯县。面积85.1平方公里,2010年美国统计局公布其人口106,114人,
  • 众议院 (日本) ?)是日本国会的下议院,最早在于1890年随着《大日本帝国宪法》的施行而成立,为日本原帝国议会两个议院之一;1947年之后则依照《日本国宪法》而改为现制。现在有465席,须每四年改
  • 飞部飞部,为汉字索引中的部首之一,康熙字典214个部首中的第一百八十三个(九划的则为第八个)。就正体中文中,飞部归于九划部首,而简体中文则归在三划。飞部只以左方、下方为部字。且无
  • 广萨河广萨河(Cuanza River),又名宽扎河,是安哥拉的河流,在首都罗安达以南流入大西洋。广萨河下游可航行的河道长150英哩,是北广萨省和南广萨省的分界线。在首项生物多样性计划中,显示广