ISO/IEC 8859

✍ dations ◷ 2025-06-09 17:39:17 #ISO/IEC 8859

ISO 8859,全称ISO 是国际标准化组织(ISO)及国际电工委员会(IEC)联合制定的一系列8位元字符集的标准,现时定义了15个字符集。

ASCII收录了空格及94个“可印刷字符”,足以给英语使用。但是,其他使用拉丁字母的语言(主要是欧洲国家的语言),都有一定数量的附加符号字母,故可以使用ASCII及控制字符以外的区域来储存及表示。

除了使用拉丁字母的语言外,使用西里尔字母的东欧语言、希腊语、泰语、现代阿拉伯语、希伯来语等,都可以使用这个形式来储存及表示。

1982年,ANSI与ECMA合作开启此项工作。1985年,公布了ECMA-94,即后来的ISO/IEC 8859 parts 1, 2, 3, 4。第5、6、7、8、9、10、11、12、13、14、15、16部分分别公布于1988年、1987年、1987年、1987年、1989年、1992年、2001年、1997年(正式宣布放弃研发)、1998年、1998年、1999年、2001年。

ISO 8859是基于ISO 2022标准的基础上,在ISO 2022规定的G0码位区域表示ISO 646的95个可打印字符;在C0与C1的控制字符码位区域,表示ISO 6429定义的控制字符;而在G1码位区域,则是由ISO 8859的16个部分各自定义扩展的可打印字符。因此,ISO 8859完全兼容7位的ASCII码。ISO 8859没有使用ISO 2022中的G2、G3区域,也不再使用ISO 2022定义的用来在不同的字符编码集或在同一个编码集的G0、G1、G2、G3区域间转换的“控制字符转义序列”。

ISO 8859统一了此前各国各语言的单独编码的混乱局面;废弃了ASCII/ISO 646使用的退格键开始的转义序列来表示变音字母的方法,而是在G1区域直接编码表示变音字母。

ISO 8859是在1980年代中期甚至1990年代才陆续公布的。因此,微软公司与IBM公司等此前已经在其产品,如MS-DOS, IBM PC上使用了各自定义的编码字符集(即“代码页”Codepage)。ISO 8859公布后,也出现了一些广泛使用的代码页兼容并扩充了ISO 8859。例如,Windows代码页1252作为英文及一些西欧语言版Windows操作系统的默认编码(locale),是 ISO 8859-1 的超集。主要扩充之处是把ISO 8859-1 的保留未用的C1区(即码位0x80-0x9F)用来编码一些可打印字符:€ ‚ ƒ „ … † ‡ ˆ ‰ Š ‹ Œ Ž ‘ ’ “ ” • – — ˜ ™ š › œ ž Ÿ 共计27个,其中各种引号就有8个。

由于英语没有任何重音字母(不计外来词),故可使用以上十五个字集中的任何一个来表示。

至于德语方面,因它除了 A-Z, a-z 外,只用 Ä, Ö, Ü, ä, ö, ß, ü 七个字母,而所有拉丁字集(1-4, 9-10, 13-16)均有此七个字母,故德语可使用以上十个字集中的任何一个来表示。

此系列中没有-12号的原因是,此计划原本要设计成一个包含塞尔特语族字符集的“Latin-7”,但后来塞尔特语族变成了ISO 8859-14 / Latin-8。亦有一说谓-12号本来是预留给印度天城体梵文的,但后来却搁置了。

每个字集定义最多96个字母或符号,在0xA0-0xFF根据不同字符集放入不同的字符。

在0xA0的位置是“不换行空格”。

在0xAD的位置,大部分都放入了“选择性连字号(英语:Soft hyphen)”(即只在一个文字在它的中间换行时才出现的连字号),若你使用的浏览器支援选择性连字号,上表将不会有任何显示。

黄色的是ISO/IEC 8859-7:2003版本及ISO/IEC 8859-8:1999版本新增的符号。LRM是“左至右符号”、RLM是“右至左符号”。

绿色的是该字集未有定义该位置。

0x00-0x1F、0x7F、0x80-0x9F在此字符集中未有定义。(控制字符是由ISO/IEC 6429定义)。

在ISO/IEC 8859-之中,国际标准化组织只替每个字符集定义了最多96个字符(0xA0-0xFF)。

ISO-8859-(在ISO与8859之间加上一连字号)则是由IANA根据ISO/IEC 8859-所定义的编码表。它除了ISO/IEC 8859-的字符外,还包括ASCII(0x20-0x7E)字符及65个控制字符(0x00-0x1F及0x7F-0x9F)。

这个号码本来是预留给印度天城体梵文的,但最终未有定义。印度有自己的编码-ISCII。

JIS X 0201是日语片假名的字符集标准,能与ISO 8859兼容。

VISCII是越南语在本土以外的侨民最常用的字符集标准。但因越南语有超过一百个重音字母,故不兼容ISO 8859。越南国家标准另有符合ISO8859标准的字符集,但字符需要组合,像泰文一样。

ISO 6438是非洲字母的字符集,但甚少被采纳。

ISO/IEC 8859 标准由 ISO/IEC 第一联合技术委员会第二分委员会第三工作组(ISO/IEC JTC 1/SC 2/WG 3)管理。2004 年 6 月,第三工作组解散,管理工作移交给第二分委员会。这份标准现在不再更新,因为这个分委员会唯一的工作组——第二工作组,正着力于ISO/IEC 10646的开发。

相关

  • 工程师工程师(英语:Engineer)是指那些在工程专业领域的人,他们使用科学知识来驾驭技术以解决实际问题,并以此为职业。工程师和科学家(scientists)往往容易混淆,科学家努力探索大自然,以便发
  • 1958年伊拉克革命伊拉克君主制历史终结 伊拉克王国被推翻 国王费萨尔二世及其家人被杀 王储阿布杜勒·伊拉被杀 伊拉克王国首相努里·赛义德被杀 哈希姆家族在伊拉克的统治终结阿拉伯联邦解
  • 卡定本杰明·路易斯·“本”·卡丁(英语:Benjamin Louis "Ben" Cardin;1943年10月5日-),是一位美国民主党政治人物,2007年起担任马里兰州美国参议院议员。此前他从未输过一次选举,在1987
  • 西巴布亚共和国西巴布亚共和国是西巴布亚地区曾经存在的一个未受国际普遍承认的国家。自荷属东印度停止存在、印度尼西亚独立之后,荷兰获得荷属东印度统治的新几内亚部分——荷属新几内亚,计
  • 莫邃莫邃(越南语:Mạc Thúy/.mw-parser-output .han-nom{font-family:"Nom Na Tong","Han-Nom Gothic","Han-Nom Ming","HAN NOM A","HAN NOM B","Ming-Lt-HKSCS-UNI-H","Ming-Lt-
  • 寒黑心《寒黑心》(英语:Ricardio the Heart Guy)是《探险时光》第一季第七集的名称。在卡通频道2010年4月26日播出。本集以小男孩芬恩和魔法狗杰克为主角,芬恩以为泡泡糖公主的新朋友,
  • 拜库恩特普尔拜库恩特普尔(Baikunthpur),是印度恰蒂斯加尔邦Koriya县的一个城镇。总人口10076(2001年)。该地2001年总人口10076人,其中男性5447人,女性4629人;0—6岁人口1312人,其中男673人,女639
  • 戴锡钦戴锡钦(1966年10月28日-),台湾政治人物,台北市人,成功高中毕业、东吴大学政治系法学士、淡江大学国际战略研究所硕士,第9至13届台北市议员,选区为松山、信义区。原为亲民党,后改投国
  • 博滕海坐标:61°30′N 19°30′E / 61.500°N 19.500°E / 61.500; 19.500博滕海(瑞典语:Bottenhavet)也称塞尔凯海(芬兰语:Selkämeri),位于北欧瑞典和芬兰之间,北连波的尼亚海湾,南与波罗
  • 布鲁马 (足球运动员)阿尔明多·图埃·纳·班格纳(Armindo Tué Na Bangna,1994年10月24日-),别名布鲁马(Bruma),是葡萄牙的职业足球运动员,司职翼锋,现时被土超俱乐部费内巴切外借至葡超球队布拉加。