自动标引

✍ dations ◷ 2025-09-09 02:10:47 #图书资讯科学,信息检索,计算机科学,计算语言学,数据挖掘,中文信息检索

自动标引(英语:Automatic Indexing)包括关键词自动提取(又称自动抽词标引)与自动赋词标引两种类型。关键词自动提取是一种识别有意义且具有代表性片段或词汇的自动化技术。关键词自动提取在文本挖掘域被称为关键词抽取(英语:Keyword Extraction),在计算语言学领域通常着眼于术语自动识别(英语:Automatic Term Recognition),在讯息检索领域,就是指自动标引。自动标引属于文本讯息抽取的范畴。文本讯息抽取是从文本数据中抽取人们关注的特定的讯息。

由于关键词是表达文件主题意义的最小单位,因此大部分对非结构化文件的自动处理,如自动标引、自动文摘、自动分类、自动聚类、相关反馈、自动过滤、事件检测与跟踪、知识挖掘、信息可视化、概念检索、检索提示、关联知识分析、自动问答等,都必须先进行关键词提取的动作,再进行其他的处理。可以说,关键词提取是所有文件自动处理的基础与核心技术。目前大多文档都不具有关键词,同时手工标引费力费时且主观性较强, 因此关键词自动标引是一项值得研究的技术。

自动标引研究可以分为三个阶段:从Luhn于1957年开始进行自动标引后开始,到目前为止,自动标引研究经历了50年的发展历程。一直到20世纪90年代初,关于关键词自动提取的研究一直就没有停止过。 20世纪90年代初到90年代末,自动标引研究渐渐冷却,原因主要包括:全文索引逐渐被人采用,并且基本上能满足用户需要;传统的自动标引方法的效率到了极限;网络兴起之初的冲击与信息需求环境的改变。20世纪90年代末一直到现在,关键词自动提取的研究逐渐升温,尤其是最近几年,关键词自动提取研究进行的如火如荼,产生该现象的主要原因为:全文索引的功能越来越难以满足实际需求,用户需要更加精确的结果;另外互联网的很多服务,例如自动摘要,文档分类与聚类,文本分析,主题检索等都要依赖于关键词自动提取的结果,只有这样才能有希望从根本上提高讯息服务品质。

根据见诸于报道的自动标引研究情况,结合自动标引研究领域的影响程度和自动标引方法的创新程度,归纳出1957~2007年五十年时间里比较有代表性的自动标引方法。

相关

  • UTC-4UTC−04:00时区比协调世界时慢4小时,使用于地区如下:
  • 卡尔·魏尔斯特拉斯卡尔·特奥多尔·威廉·魏尔施特拉斯(德语:Karl Theodor Wilhelm Weierstraß(发音:),姓氏可写作Weierstrass,1815年10月31日-1897年2月19日),德国数学家,被誉为“现代分析之父”。卡尔
  • 鸡蛋鸡蛋,又称鸡卵,是鸡所生、带有硬壳的卵,受精之后可孵出小鸡。鸡蛋由蛋壳保护,而当中的蛋白和蛋黄被各种薄膜包裹,并且是人类重要食物。新鲜鸡蛋密度较水更大些,会沉入水底。随着呼
  • 欧付宝坐标:25°03′22.9″N 121°36′49.8″E / 25.056361°N 121.613833°E / 25.056361; 121.613833欧付宝电子支付股份有限公司(英语:O'Pay Electronic Payment CO.,Ltd.)为一家台
  • 纸袋纸袋,即用纸做的袋子。通常可以用作购物袋使用。纸张方便印刷的特性可以给产品很好的宣传。1852年,教师出身的美国人弗朗西斯·沃尔(英语:Francis Wolle),发明了第一台大批量生产
  • 重生重生可以指:
  • 烹杀烹刑,或称烹杀,是一种酷刑。施刑者先将犯人的衣服脱光,并将犯人推入一个如成人般高的大锅,盛有油或水,放在柴火上烹煮。犯人大多数都因灼伤死去,有些最终全身烧焦。历史上的著名受
  • 东学党东学是朝鲜王朝时期的一个宋明理学思想体系,于1860年由庆州出身的崔济愚创立。信奉东学的集团称为东学党。东学与倡导西方文化的西学相对,东学运动旨在恢复朝鲜民族单一神(하느
  • 野西瓜苗野西瓜苗(学名:Hibiscus trionum),又名香铃草、小秋葵、打瓜花、山西瓜秧,是一种锦葵科木槿属一年生草本植物。野西瓜苗的分枝横升或斜升,半空心,上有白色开叉的细毛,高约20-50cm,但
  • 湖广等处行中书省湖广等处行中书省(湖广行中书省),为直属元朝的一级行政区,简称“湖广”或“湖广省”,在当时民间多简称为鄂州行省、潭州行省、湖广行省。元世祖至元十一年(1274年)置荆湖等路行中书