自动标引

✍ dations ◷ 2025-06-28 15:18:46 #图书资讯科学,信息检索,计算机科学,计算语言学,数据挖掘,中文信息检索

自动标引(英语:Automatic Indexing)包括关键词自动提取(又称自动抽词标引)与自动赋词标引两种类型。关键词自动提取是一种识别有意义且具有代表性片段或词汇的自动化技术。关键词自动提取在文本挖掘域被称为关键词抽取(英语:Keyword Extraction),在计算语言学领域通常着眼于术语自动识别(英语:Automatic Term Recognition),在讯息检索领域,就是指自动标引。自动标引属于文本讯息抽取的范畴。文本讯息抽取是从文本数据中抽取人们关注的特定的讯息。

由于关键词是表达文件主题意义的最小单位,因此大部分对非结构化文件的自动处理,如自动标引、自动文摘、自动分类、自动聚类、相关反馈、自动过滤、事件检测与跟踪、知识挖掘、信息可视化、概念检索、检索提示、关联知识分析、自动问答等,都必须先进行关键词提取的动作,再进行其他的处理。可以说,关键词提取是所有文件自动处理的基础与核心技术。目前大多文档都不具有关键词,同时手工标引费力费时且主观性较强, 因此关键词自动标引是一项值得研究的技术。

自动标引研究可以分为三个阶段:从Luhn于1957年开始进行自动标引后开始,到目前为止,自动标引研究经历了50年的发展历程。一直到20世纪90年代初,关于关键词自动提取的研究一直就没有停止过。 20世纪90年代初到90年代末,自动标引研究渐渐冷却,原因主要包括:全文索引逐渐被人采用,并且基本上能满足用户需要;传统的自动标引方法的效率到了极限;网络兴起之初的冲击与信息需求环境的改变。20世纪90年代末一直到现在,关键词自动提取的研究逐渐升温,尤其是最近几年,关键词自动提取研究进行的如火如荼,产生该现象的主要原因为:全文索引的功能越来越难以满足实际需求,用户需要更加精确的结果;另外互联网的很多服务,例如自动摘要,文档分类与聚类,文本分析,主题检索等都要依赖于关键词自动提取的结果,只有这样才能有希望从根本上提高讯息服务品质。

根据见诸于报道的自动标引研究情况,结合自动标引研究领域的影响程度和自动标引方法的创新程度,归纳出1957~2007年五十年时间里比较有代表性的自动标引方法。

相关

  • 皮质类固醇皮质类固醇(英语:Corticosteroids)是由肾上腺皮质制造和分泌的类固醇激素,也可经由人工合成。它的药理作用复杂,且广泛涉及生理系统作用,如压力反应、免疫反应,以及发炎、糖类代谢
  • 猪只猪科(学名:Suidae)属于哺乳纲偶蹄目,共有约20种现生物种与许多化石物种,包括家猪以及疣猪和鹿豚等多种野猪。所有物种均原产于亚洲、欧洲、非洲等旧大陆地区。已知最早的猪科化石
  • 挪威语挪威语(norsk),中文也称挪威文,是日耳曼语族的一个分支,普遍通用于挪威,也是挪威的官方语言。挪威语与瑞典语和丹麦语十分相似,所以这三种语言的人可以互相沟通。由于丹麦语从十六
  • 偶像崇拜偶像崇拜通常指对任何一种人物的崇拜,与一神论的独一真神(上帝)相对,因其都是人手所造的物体。在亚伯拉罕诸教中,被认为是一项主要的罪,有时导致激烈的破坏偶像运动。“破坏偶像主
  • 长形试纸浸棒(英语:dipstick)是可以浸入液体来测量含量,或测试成分。测试浸棒通常由纸或纸板制成。它包含的物质,当发现目标成分出现在液体中就会变色。测量浸棒显示容器内的液体含量。这
  • 安道尔侯国安道尔公国(加泰罗尼亚语:Principat d'Andorra),也译作安道拉亲王国,通称安道尔,为一微型国家,国土面积468平方千米。是西南欧的内陆亲王国,位于比利牛斯山脉东南部,毗邻法国和西班牙
  • 电子盐电子盐、电子化合物是一类新型的化合物,其中以电子作阴离子。 第一个研究的电子盐是碱金属的液氨溶液。 比如,钠溶于液氨时,会生成含有+及溶剂合电子的蓝色溶液。此类溶液是强
  • 皇家全国救生艇协会皇家全国救生艇协会(Royal National Lifeboat Institution,缩写:RNLI)是一个提供不列颠群岛附近海域救生服务的慈善组织。由乔治五世提供赞助而成立于1824年3月4日,当时称“Natio
  • 花楸花楸树(学名:),又名欧洲花楸、百华花楸、红果臭山槐、山槐子(河北土名)、马加木(东北土名)等,是蔷薇科花楸属的植物。广泛分布于欧亚大陆及非洲北部部分地区。其果实可以食用,叶子可以
  • 1967年夏季世界大学生运动会第五届夏季世界大学生运动会于1967年8月27日至9月4日在日本东京举行,这是世界大学生运动会首次在亚洲举办,共有32个国家和地区的1,729名运动员参加。