自动标引

✍ dations ◷ 2025-11-04 20:03:34 #图书资讯科学,信息检索,计算机科学,计算语言学,数据挖掘,中文信息检索

自动标引(英语:Automatic Indexing)包括关键词自动提取(又称自动抽词标引)与自动赋词标引两种类型。关键词自动提取是一种识别有意义且具有代表性片段或词汇的自动化技术。关键词自动提取在文本挖掘域被称为关键词抽取(英语:Keyword Extraction),在计算语言学领域通常着眼于术语自动识别(英语:Automatic Term Recognition),在讯息检索领域,就是指自动标引。自动标引属于文本讯息抽取的范畴。文本讯息抽取是从文本数据中抽取人们关注的特定的讯息。

由于关键词是表达文件主题意义的最小单位,因此大部分对非结构化文件的自动处理,如自动标引、自动文摘、自动分类、自动聚类、相关反馈、自动过滤、事件检测与跟踪、知识挖掘、信息可视化、概念检索、检索提示、关联知识分析、自动问答等,都必须先进行关键词提取的动作,再进行其他的处理。可以说,关键词提取是所有文件自动处理的基础与核心技术。目前大多文档都不具有关键词,同时手工标引费力费时且主观性较强, 因此关键词自动标引是一项值得研究的技术。

自动标引研究可以分为三个阶段:从Luhn于1957年开始进行自动标引后开始,到目前为止,自动标引研究经历了50年的发展历程。一直到20世纪90年代初,关于关键词自动提取的研究一直就没有停止过。 20世纪90年代初到90年代末,自动标引研究渐渐冷却,原因主要包括:全文索引逐渐被人采用,并且基本上能满足用户需要;传统的自动标引方法的效率到了极限;网络兴起之初的冲击与信息需求环境的改变。20世纪90年代末一直到现在,关键词自动提取的研究逐渐升温,尤其是最近几年,关键词自动提取研究进行的如火如荼,产生该现象的主要原因为:全文索引的功能越来越难以满足实际需求,用户需要更加精确的结果;另外互联网的很多服务,例如自动摘要,文档分类与聚类,文本分析,主题检索等都要依赖于关键词自动提取的结果,只有这样才能有希望从根本上提高讯息服务品质。

根据见诸于报道的自动标引研究情况,结合自动标引研究领域的影响程度和自动标引方法的创新程度,归纳出1957~2007年五十年时间里比较有代表性的自动标引方法。

相关

  • 身心性疾病身心性疾病,也翻译成身心症(somatoform disorder),是指由心理引起生理的疾病。
  • 旋转对称性在数学里,给予一个定义于内积空间的函数,假若对于任意旋转,函数的参数值可能会改变,但是函数的数值仍旧保持不变,则称此性质为旋转不变性(rotational invariance),或旋转对称性(rotat
  • 大革命法国大革命(法语:Révolution française, 1789年-1799年)是法国的一段社会激进与政治动荡的时期,对于法国历史以及全欧洲都留下深刻广泛影响。法国政治体制在大革命期间发生了众
  • 剩磁剩磁(Remanence)符号为Br,是指磁体经磁化至饱和以后,撤去外磁场,在原来外磁场方向上仍能保持一定的磁化强度。剩磁的极限值为饱和磁化强度。永磁材料的剩磁主要受材料中各个晶粒
  • 欧亚大陆板块欧亚板块(英语:Eurasian Plate)为包括大部分欧亚地区的板块,但不含括南亚的印度半岛(印度次大陆)、西南亚的阿拉伯半岛(阿拉伯次大陆)以及东西伯利亚的上扬斯克山脉以东(属鄂霍次克板
  • 社交活动社交,是包含人类在内等有生命的有机体与他们所意识到的其他生物(包含有生命的有机体同类)产生互动与交流,无论此互动来往是志愿或非志愿(英语:volition (psychology))的。
  • 西乌克兰乌克兰反抗军(Ukrainian Insurgent Army,Українська Повстанська Армія;Ukrayins'ka Povstans'ka Armiya,简称UPA)是一个位在乌克兰的民族主义准军事
  • 有道有道是一个网络搜索引擎。由中国互联网公司网易推出。2006年,有道搜索测试版出现。2007年12月11日,正式版推出。作为门户网站的搜索,提供用户:网页、图片、热闻、购物、音乐、视
  • 纳瓦人纳瓦人,又称纳瓦特尔人(纳瓦特尔语:Nahuatlacah;西班牙语:Nahuas)指的是位在墨西哥中部使用阿兹特克方言—纳瓦特尔语的族群。其为墨西哥最大的美洲原住民族群(1990统计人数为1,197
  • 格拉耶山格拉耶山(意大利语:Alpi Graie ,;法语:Alpes grées,.mw-parser-output .IPA{font-family:"Charis SIL","Doulos SIL","Linux Libertine","Segoe UI","Lucida Sans Unicode","Code