自动标引

✍ dations ◷ 2025-11-28 08:08:00 #图书资讯科学,信息检索,计算机科学,计算语言学,数据挖掘,中文信息检索

自动标引(英语:Automatic Indexing)包括关键词自动提取(又称自动抽词标引)与自动赋词标引两种类型。关键词自动提取是一种识别有意义且具有代表性片段或词汇的自动化技术。关键词自动提取在文本挖掘域被称为关键词抽取(英语:Keyword Extraction),在计算语言学领域通常着眼于术语自动识别(英语:Automatic Term Recognition),在讯息检索领域,就是指自动标引。自动标引属于文本讯息抽取的范畴。文本讯息抽取是从文本数据中抽取人们关注的特定的讯息。

由于关键词是表达文件主题意义的最小单位,因此大部分对非结构化文件的自动处理,如自动标引、自动文摘、自动分类、自动聚类、相关反馈、自动过滤、事件检测与跟踪、知识挖掘、信息可视化、概念检索、检索提示、关联知识分析、自动问答等,都必须先进行关键词提取的动作,再进行其他的处理。可以说,关键词提取是所有文件自动处理的基础与核心技术。目前大多文档都不具有关键词,同时手工标引费力费时且主观性较强, 因此关键词自动标引是一项值得研究的技术。

自动标引研究可以分为三个阶段:从Luhn于1957年开始进行自动标引后开始,到目前为止,自动标引研究经历了50年的发展历程。一直到20世纪90年代初,关于关键词自动提取的研究一直就没有停止过。 20世纪90年代初到90年代末,自动标引研究渐渐冷却,原因主要包括:全文索引逐渐被人采用,并且基本上能满足用户需要;传统的自动标引方法的效率到了极限;网络兴起之初的冲击与信息需求环境的改变。20世纪90年代末一直到现在,关键词自动提取的研究逐渐升温,尤其是最近几年,关键词自动提取研究进行的如火如荼,产生该现象的主要原因为:全文索引的功能越来越难以满足实际需求,用户需要更加精确的结果;另外互联网的很多服务,例如自动摘要,文档分类与聚类,文本分析,主题检索等都要依赖于关键词自动提取的结果,只有这样才能有希望从根本上提高讯息服务品质。

根据见诸于报道的自动标引研究情况,结合自动标引研究领域的影响程度和自动标引方法的创新程度,归纳出1957~2007年五十年时间里比较有代表性的自动标引方法。

相关

  • 柳氮磺胺吡啶柳氮磺胺吡啶(Sulfasalazine),缩写为SSZ,是一种磺胺类药物,可用于治疗类风湿性关节炎、溃疡性结肠炎,以及克罗恩病。柳氮磺胺吡啶最早于1950年在美国获批上市,目前仍然是治疗类风湿
  • 氢氧化物氢氧离子,旧称沎,化学符号为OH-。其中氢和氧之间以共价键连接,整体带一单位的负电荷。常常与不同的元素组成氢氧化物。一个氧原子和一个氢原子以共价键结合之后,通常以两种方式
  • 北方邦北方邦(印地语:उत्तर प्रदेश;拉丁字母转写:Uttar Pradesh)处于印度北部,和尼泊尔接壤,毗邻国内的北阿坎德邦、喜马偕尔邦、哈里亚纳邦、拉贾斯坦邦、中央邦以及比哈尔邦
  • 吕宋海峡吕宋海峡(Luzon Strait),是台湾本岛和吕宋岛之间的海峡,被其中的巴丹群岛和巴布延群岛又分为巴士海峡、巴林塘海峡和巴布延海峡三条水道。吕宋海峡东接太平洋,西通南海,全宽约250
  • 宋元学案《宋元学案》,共100卷,最早为明末清初黄宗羲整理。康熙十五年(1676年)黄宗羲完成《明儒学案》后续修此书,仅成17卷并序而卒,其子黄百家续作,又成8卷,后由弟子全祖望、杨开沅、顾
  • 德 惠德惠(1801年-?),字孚之,号济堂,伊尔根觉罗氏,奉天锦州满洲正黄旗人。清朝政治人物、进士出身。德惠是道光乙酉科举人。道光十二年,考取壬辰恩科进士。德惠曾任光禄寺署丞,詹事府右春坊
  • 孙立军孙立军(1964年-),河北保定人,中国动画研究家、教育家。毕业于北京电影学院动画专业,1988年起开始从事教师工作。目前是北京电影学院副院长、北京电影学院动画学院院长、教授、硕士
  • 南海岸 (北里约格朗德州)南海岸(葡萄牙语:Litoral Sul)是巴西东北部北里约格朗德州东波蒂瓜尔中区的一个小区。南海岸下辖以下的市镇:
  • 1-乙基-(3-二甲基氨基丙基)碳酰二亚胺1-乙基-3-(3-二甲基氨基丙基)碳酰二亚胺(亦称为EDC、EDAC或EDCI)是一种水溶性碳二亚胺,常制成盐酸盐之形式。其pH范围通常在4.0-6.0。EDC常在伯胺制备酰氨时作为羧基活化剂。ED
  • 前置四驱前置四驱(英语:Front-engine, Four-wheel drive layout,简写:F4)意指引擎前置在车头,由四轮驱动整辆汽车的方式。由于四轮均有动力,相对于只靠前轮或后轮驱动的设计,前置四驱拥有较