自动标引

✍ dations ◷ 2025-10-07 22:38:15 #图书资讯科学,信息检索,计算机科学,计算语言学,数据挖掘,中文信息检索

自动标引(英语:Automatic Indexing)包括关键词自动提取(又称自动抽词标引)与自动赋词标引两种类型。关键词自动提取是一种识别有意义且具有代表性片段或词汇的自动化技术。关键词自动提取在文本挖掘域被称为关键词抽取(英语:Keyword Extraction),在计算语言学领域通常着眼于术语自动识别(英语:Automatic Term Recognition),在讯息检索领域,就是指自动标引。自动标引属于文本讯息抽取的范畴。文本讯息抽取是从文本数据中抽取人们关注的特定的讯息。

由于关键词是表达文件主题意义的最小单位,因此大部分对非结构化文件的自动处理,如自动标引、自动文摘、自动分类、自动聚类、相关反馈、自动过滤、事件检测与跟踪、知识挖掘、信息可视化、概念检索、检索提示、关联知识分析、自动问答等,都必须先进行关键词提取的动作,再进行其他的处理。可以说,关键词提取是所有文件自动处理的基础与核心技术。目前大多文档都不具有关键词,同时手工标引费力费时且主观性较强, 因此关键词自动标引是一项值得研究的技术。

自动标引研究可以分为三个阶段:从Luhn于1957年开始进行自动标引后开始,到目前为止,自动标引研究经历了50年的发展历程。一直到20世纪90年代初,关于关键词自动提取的研究一直就没有停止过。 20世纪90年代初到90年代末,自动标引研究渐渐冷却,原因主要包括:全文索引逐渐被人采用,并且基本上能满足用户需要;传统的自动标引方法的效率到了极限;网络兴起之初的冲击与信息需求环境的改变。20世纪90年代末一直到现在,关键词自动提取的研究逐渐升温,尤其是最近几年,关键词自动提取研究进行的如火如荼,产生该现象的主要原因为:全文索引的功能越来越难以满足实际需求,用户需要更加精确的结果;另外互联网的很多服务,例如自动摘要,文档分类与聚类,文本分析,主题检索等都要依赖于关键词自动提取的结果,只有这样才能有希望从根本上提高讯息服务品质。

根据见诸于报道的自动标引研究情况,结合自动标引研究领域的影响程度和自动标引方法的创新程度,归纳出1957~2007年五十年时间里比较有代表性的自动标引方法。

相关

  • 人体人体是一个人的整个结构。 它由许多不同类型的细胞组成,一起产生组织和随后的器官系统。 它们确保体内稳态和人体的生存能力。它包括头部,颈部,躯干(包括胸部和腹部),胳膊和手,腿和
  • SGLT2抑制剂钠-葡萄糖协同转运蛋白2抑制剂(英语:SGLT2 inhibitors,简称SGLT2抑制剂,或称列净类药物(英语:Gliflozin))是一种通过抑制葡萄糖在肾脏内重吸收而起到降糖作用的抗糖尿病药。 其原理
  • 血液检验血液检查(英语:Blood test),是指通过采血以获得受检者的血液,并利用其进行临床检查以获取受检者的健康状况。主要通过医检师进行检验。血液检查主要用于判断患者在一定时间内的身
  • 柯本气候分类法柯本气候分类法(德语:Effektive Klimaklassifikation,意为“有效气候分类法”),最被广泛被使用的气候分类法,由德国气候学家弗拉迪米尔·彼得·柯本所发展出来的气候分类法,1918年
  • 全新世纪年全新世纪年或人类纪年(Holocene calendar或Human Era),与公元相对应,简称人元(HE),是一种由现时采用的公历(即格里历)改良而来的纪年方法,它引入0年,并在公历年数上多加 10000 。例如公
  • 明律《大明律》,全名为《大明律集解附例》,是明代的法令条例,由开国皇帝朱元璋总结历代法律施行的经验和教训而详细制定而成。按《明史·刑法志》,元至正二十五年(1365年),朱元璋占领武
  • 剧院剧场,有时又称剧院,意指特定的、由永久性的建筑体构成的表演场所,亦可作为表演场所的总称。剧院通常指室内的表演场所,而剧场则同时适用于户外广场及室内建筑。古代称为“勾栏”
  • C5a受体n/an/an/an/an/an/an/an/an/an/aC5a受体(英语:C5a receptor或称补体成分5a受体1,complement component 5a receptor 1,C5AR1或CD88,Cluster of Differentiation 88)是一种与补体C5
  • 孙经先孙经先(1948年1月-),现任徐州师范大学数学学院特聘教授,山东大学兼职教授、博士生导师,华东石油大学兼职教授,全国非线性泛函分析学术会议联络组成员。1981年获理学硕士学位 1984年
  • 英语帝国主义英语帝国主义是语言帝国主义的一种。现代社会英语的广泛使用引起了各种问题,从历史的角度提出了此概念。Robert Phillipson在一书中定义是:在英语和其他语言之间,由于结构和文