ISO/IEC 8859

✍ dations ◷ 2025-07-11 18:51:48 #ISO/IEC 8859

ISO 8859,全称ISO 是国际标准化组织(ISO)及国际电工委员会(IEC)联合制定的一系列8位元字符集的标准,现时定义了15个字符集。

ASCII收录了空格及94个“可印刷字符”,足以给英语使用。但是,其他使用拉丁字母的语言(主要是欧洲国家的语言),都有一定数量的附加符号字母,故可以使用ASCII及控制字符以外的区域来储存及表示。

除了使用拉丁字母的语言外,使用西里尔字母的东欧语言、希腊语、泰语、现代阿拉伯语、希伯来语等,都可以使用这个形式来储存及表示。

1982年,ANSI与ECMA合作开启此项工作。1985年,公布了ECMA-94,即后来的ISO/IEC 8859 parts 1, 2, 3, 4。第5、6、7、8、9、10、11、12、13、14、15、16部分分别公布于1988年、1987年、1987年、1987年、1989年、1992年、2001年、1997年(正式宣布放弃研发)、1998年、1998年、1999年、2001年。

ISO 8859是基于ISO 2022标准的基础上,在ISO 2022规定的G0码位区域表示ISO 646的95个可打印字符;在C0与C1的控制字符码位区域,表示ISO 6429定义的控制字符;而在G1码位区域,则是由ISO 8859的16个部分各自定义扩展的可打印字符。因此,ISO 8859完全兼容7位的ASCII码。ISO 8859没有使用ISO 2022中的G2、G3区域,也不再使用ISO 2022定义的用来在不同的字符编码集或在同一个编码集的G0、G1、G2、G3区域间转换的“控制字符转义序列”。

ISO 8859统一了此前各国各语言的单独编码的混乱局面;废弃了ASCII/ISO 646使用的退格键开始的转义序列来表示变音字母的方法,而是在G1区域直接编码表示变音字母。

ISO 8859是在1980年代中期甚至1990年代才陆续公布的。因此,微软公司与IBM公司等此前已经在其产品,如MS-DOS, IBM PC上使用了各自定义的编码字符集(即“代码页”Codepage)。ISO 8859公布后,也出现了一些广泛使用的代码页兼容并扩充了ISO 8859。例如,Windows代码页1252作为英文及一些西欧语言版Windows操作系统的默认编码(locale),是 ISO 8859-1 的超集。主要扩充之处是把ISO 8859-1 的保留未用的C1区(即码位0x80-0x9F)用来编码一些可打印字符:€ ‚ ƒ „ … † ‡ ˆ ‰ Š ‹ Œ Ž ‘ ’ “ ” • – — ˜ ™ š › œ ž Ÿ 共计27个,其中各种引号就有8个。

由于英语没有任何重音字母(不计外来词),故可使用以上十五个字集中的任何一个来表示。

至于德语方面,因它除了 A-Z, a-z 外,只用 Ä, Ö, Ü, ä, ö, ß, ü 七个字母,而所有拉丁字集(1-4, 9-10, 13-16)均有此七个字母,故德语可使用以上十个字集中的任何一个来表示。

此系列中没有-12号的原因是,此计划原本要设计成一个包含塞尔特语族字符集的“Latin-7”,但后来塞尔特语族变成了ISO 8859-14 / Latin-8。亦有一说谓-12号本来是预留给印度天城体梵文的,但后来却搁置了。

每个字集定义最多96个字母或符号,在0xA0-0xFF根据不同字符集放入不同的字符。

在0xA0的位置是“不换行空格”。

在0xAD的位置,大部分都放入了“选择性连字号(英语:Soft hyphen)”(即只在一个文字在它的中间换行时才出现的连字号),若你使用的浏览器支援选择性连字号,上表将不会有任何显示。

黄色的是ISO/IEC 8859-7:2003版本及ISO/IEC 8859-8:1999版本新增的符号。LRM是“左至右符号”、RLM是“右至左符号”。

绿色的是该字集未有定义该位置。

0x00-0x1F、0x7F、0x80-0x9F在此字符集中未有定义。(控制字符是由ISO/IEC 6429定义)。

在ISO/IEC 8859-之中,国际标准化组织只替每个字符集定义了最多96个字符(0xA0-0xFF)。

ISO-8859-(在ISO与8859之间加上一连字号)则是由IANA根据ISO/IEC 8859-所定义的编码表。它除了ISO/IEC 8859-的字符外,还包括ASCII(0x20-0x7E)字符及65个控制字符(0x00-0x1F及0x7F-0x9F)。

这个号码本来是预留给印度天城体梵文的,但最终未有定义。印度有自己的编码-ISCII。

JIS X 0201是日语片假名的字符集标准,能与ISO 8859兼容。

VISCII是越南语在本土以外的侨民最常用的字符集标准。但因越南语有超过一百个重音字母,故不兼容ISO 8859。越南国家标准另有符合ISO8859标准的字符集,但字符需要组合,像泰文一样。

ISO 6438是非洲字母的字符集,但甚少被采纳。

ISO/IEC 8859 标准由 ISO/IEC 第一联合技术委员会第二分委员会第三工作组(ISO/IEC JTC 1/SC 2/WG 3)管理。2004 年 6 月,第三工作组解散,管理工作移交给第二分委员会。这份标准现在不再更新,因为这个分委员会唯一的工作组——第二工作组,正着力于ISO/IEC 10646的开发。

相关

  • 美利坚合众国宪法第五条修正案宪法正文I ∙ II ∙ III ∙ IV ∙ V ∙ VI ∙ VII其它修正案 XI ∙ XII ∙ XIII ∙ XIV ∙ XV XVI ∙ XVII ∙ XVIII ∙ XIX ∙ XX XXI ∙ XXII ∙ XXIII ∙
  • 鸭跖草类植物鸭跖草类植物(commelinids)是在被子植物分类学中APG 分类法和APG II 分类法中设立的一个演化支,属于单子叶植物下的二级分支。在鸭跖草类中的植物种类具有基因演化中的亲缘关系
  • 亚兹德省亚兹德省(波斯语:یزد)是伊朗三十一个省份之一。面积129,285平方公里,在伊朗所有省份中位列第七。根据1996年的人口普查结果,亚兹德省人口为750,769 ,其中75.1 %为城镇居民,24.9
  • 薤(“薤”,拼音:xiè,注音:ㄒㄧㄝˋ,学名:),为五种荤菜之一。分布在柬埔寨、越南、日本、台湾、美国、老挝以及中国大陆的长江流域和以南各省区等地,生长于海拔700米至2,700米的地区。
  • 鲍大志鲍大志,中国北京人民艺术剧院话剧演员,与梁冠华、王姬、宋丹丹是同班同学。电视代表作品《三国演义》的汉献帝、电影代表作品《贫嘴张大民的幸福生活》的张大军。
  • 曲直濑道三曲直濑道三(日语:曲直瀬道三/まなせ どうさん ,1507年10月23日-1594年2月23日)是日本战国时代医师,号道三,本名正盛,字一溪,又称虽知苦斋、翠竹庵和启迪庵,本姓为源氏,后来改姓橘氏,今大
  • 霧台乡坐标:22°44′56″N 120°43′42″E / 22.7490234°N 120.7282181°E / 22.7490234; 120.7282181霧台乡(鲁凯语:Vudai)位于台湾屏东县东北部,属屏东县的八个山地乡之一,人口仅3.3
  • 资源交换文件格式资源交换文件格式(英语:Resource Interchange File Format,缩写为RIFF),又译资源互换文件格式,是一种文件格式()标准,把资料存储在被标记的区块(tagged chunks)中。它是在1991年时,由Mic
  • 蒙里河蒙里河,是位于中国广西壮族自治区百色市隆林各族自治县西部的一条河流,属于领好河右岸支流,发源于隆林县革步乡九腾村西北,南流至蒙里村(原蒙里乡)后转向西,至红染村北入领好河。河
  • 巴拿马河流列表此列表列出了巴拿马的河流。本列表按流域分类,再自西向东排列。Template:Panama topics