自动标引

✍ dations ◷ 2025-04-04 22:59:40 #图书资讯科学,信息检索,计算机科学,计算语言学,数据挖掘,中文信息检索

自动标引(英语:Automatic Indexing)包括关键词自动提取(又称自动抽词标引)与自动赋词标引两种类型。关键词自动提取是一种识别有意义且具有代表性片段或词汇的自动化技术。关键词自动提取在文本挖掘域被称为关键词抽取(英语:Keyword Extraction),在计算语言学领域通常着眼于术语自动识别(英语:Automatic Term Recognition),在讯息检索领域,就是指自动标引。自动标引属于文本讯息抽取的范畴。文本讯息抽取是从文本数据中抽取人们关注的特定的讯息。

由于关键词是表达文件主题意义的最小单位,因此大部分对非结构化文件的自动处理,如自动标引、自动文摘、自动分类、自动聚类、相关反馈、自动过滤、事件检测与跟踪、知识挖掘、信息可视化、概念检索、检索提示、关联知识分析、自动问答等,都必须先进行关键词提取的动作,再进行其他的处理。可以说,关键词提取是所有文件自动处理的基础与核心技术。目前大多文档都不具有关键词,同时手工标引费力费时且主观性较强, 因此关键词自动标引是一项值得研究的技术。

自动标引研究可以分为三个阶段:从Luhn于1957年开始进行自动标引后开始,到目前为止,自动标引研究经历了50年的发展历程。一直到20世纪90年代初,关于关键词自动提取的研究一直就没有停止过。 20世纪90年代初到90年代末,自动标引研究渐渐冷却,原因主要包括:全文索引逐渐被人采用,并且基本上能满足用户需要;传统的自动标引方法的效率到了极限;网络兴起之初的冲击与信息需求环境的改变。20世纪90年代末一直到现在,关键词自动提取的研究逐渐升温,尤其是最近几年,关键词自动提取研究进行的如火如荼,产生该现象的主要原因为:全文索引的功能越来越难以满足实际需求,用户需要更加精确的结果;另外互联网的很多服务,例如自动摘要,文档分类与聚类,文本分析,主题检索等都要依赖于关键词自动提取的结果,只有这样才能有希望从根本上提高讯息服务品质。

根据见诸于报道的自动标引研究情况,结合自动标引研究领域的影响程度和自动标引方法的创新程度,归纳出1957~2007年五十年时间里比较有代表性的自动标引方法。

相关

  • LIF1EMR, 1PVH, 2Q7N· receptor binding · cytokine activity · leukemia inhibitory factor receptor binding· immune response · multicellular organismal develop
  • 克洛德·洛兰克洛德·洛兰 (法语:Claude Lorrain,约1600年-1682年11月21日),也译作劳兰、劳伦或罗兰恩,原名克洛德·热莱(法语:Claude Gellée),是法国巴洛克时期的风景画家,但主要活动是在意大利。
  • 朱 静朱静(1938年10月10日-),中国材料科学家。原籍浙江杭州,生于上海。1962年毕业于复旦大学物理系。清华大学教授,中国科学院院士,世界科学院院士,是中国电子显微镜研究领域的先驱者之一
  • 农具农具是农业生产中使用的工具。
  • 平面几何欧几里得几何指按照欧几里得的《几何原本》构造的几何学。欧几里得几何有时就指二维平面上的几何,即平面几何,本文主要描述平面几何。三维空间的欧几里得几何通常叫做立体几何
  • 布拉干省布拉卡省或译布拉坎省(Bulacan)是菲律宾的一个省份,位于中央吕宋政区。首府是马洛洛斯市。布拉卡省西邻邦板牙省、北邻新怡诗夏省、奥罗拉省及奎松省,南边为黎刹省。布拉卡省也
  • 平安银行大厦平安银行大厦(原名深圳发展银行大厦)是中华人民共和国广东省深圳市罗湖区的一座摩天大楼,地处深圳市深南东路5047号,1992年12月28日开始建设,1997年1月18日正式启用,曾长期作为深
  • 金日成的个人崇拜朝鲜的个人崇拜是指朝鲜民主主义人民共和国人民对该国执政家族——金日成家族的个人崇拜,此偶像崇拜自首任领导金日成于1948年掌管权力后一直延续至今。因此,这也成为了朝鲜文
  • 北元北元(蒙古语:.mw-parser-output .font-mong{font-family:"Menk Hawang Tig","Menk Qagan Tig","Menk Garqag Tig","Menk Har_a Tig","Menk Scnin Tig","Oyun Gurban Ulus Tig"
  • 2,3-二氢呋喃2,3-二氢呋喃(英语:2,3-Dihydrofuran)是一种杂环化合物。是最简单的烯醇醚之一。