SSE

✍ dations ◷ 2025-06-29 12:48:13 #并发计算,X86架构

SSE(Streaming SIMD Extensions)是英特尔在AMD的3D Now!发布一年之后,在其计算机芯片Pentium III中引入的指令集,是继MMX的扩展指令集。SSE指令集提供了70条新指令。AMD后来在Athlon XP中加入了对这个新指令集的支持。

SSE加入新的8个128位寄存器(XMM0~XMM7)。而AMD发表的x86-64延伸架构(又称AMD64)再加入额外8个寄存器。除此之外还有一个新的32位的控制/状态寄存器(MXCSR)。不过只能在64位的模式下才能使用额外8个寄存器。

每个寄存器可以容纳4个32位单精度浮点数,或是2个64位双精度浮点数,或是4个32位整数,或是8个16位短整数,或是16个字符。整数运算能够使用正负号运算。而整数SIMD运算可能仍然要与8个64位MMX寄存器一起运行。

因为操作系统必须要在进程切换的时候保护这些128位的寄存器状态,除非操作系统去引导这些寄存器,否则默认值是不会去激活的。这表示操作系统必须要知道如何使用FXSAVE与FXRSTOR指令才能存储x87与SSE寄存器的状态。而在当时IA-32的主流操作系统很快的都加入了此功能。

由于SSE加入了浮点支持,SSE就比MMX更加常用。而SSE2加入了整数运算支持之后让SSE更加的有弹性,当MMX变成是多余的指令集,SSE指令集甚至可以与MMX并发运作,在某些时候可以提供额外的性能增进。

第一个支持SSE的CPU是Pentium III,在FPU与SSE之间共享运行支持。当编译出来的软件能够交叉的同时以FPU与SSE运作,Pentium III并无法在同一个周期中同时运行FPU与SSE。这个限制降低了指令管线的有效性,不过XMM寄存器能够让SIMD与标量浮点运算混合运行,而不会因为切换MMX/浮点模式而产生性能的折损。

SSE提供标量与包裹式(packed)浮点指令。

下面这个例子演示了使用SSE的优点。向量加法在计算机图形中很常用,如果在x86平台上想将四对单精度浮点数相加,必须使用四对浮点相加指令。

vec_res.x = v1.x + v2.x;vec_res.y = v1.y + v2.y;vec_res.z = v1.z + v2.z;vec_res.w = v1.w + v2.w;

上面这段代码会被编译成4条x86 FADD指令。下面的伪代码展示用128位包裹式相加(packed-add)指令替代4个纯量相加指令。

 movaps xmm0,           ;xmm0 = v1.w | v1.z | v1.y | v1.x  addps xmm0,            ;xmm0 = v1.w+v2.w | v1.z+v2.z | v1.y+v2.y | v1.x+v2.x                movaps , xmm0

后续版本

SSE2

SSE2是Intel在Pentium 4处理器的最初版本中引入的,但是AMD后来在Opteron和Athlon 64处理器中也加入了SSE2的支持。SSE2指令集添加了对64位双精度浮点数的支持,以及对整型数据的支持,也就是说这个指令集中所有的MMX指令都是多余的了,同时也避免了占用浮点数寄存器。这个指令集还增加了对CPU缓存的控制指令。AMD对它的扩展增加了8个XMM寄存器,但是需要切换到64位模式(x86-64/AMD64)才可以使用这些寄存器。Intel后来在其Intel 64架构中也增加了对x86-64的支持。

SSE3是Intel在Pentium 4处理器的Prescott核心中引入的第三代SIMD指令集,AMD在Athlon 64的第五个版本,Venice核心中也加入了SSE3的支持。这个指令集扩展的指令包含寄存器的局部位之间的运算,例如高位和低位之间的加减运算;浮点数到整数的转换,以及对超线程技术的支持。

SSSE3是Intel针对SSE3指令集的一次额外扩展,最早内置于Core 2 Duo处理器中。

SSE4是Intel在Penryn核心的Core 2 Duo与Core 2 Solo处理器时,新增的47条新多媒体指令集,现在SSE4版本更新至SSE4.2。

AMD也开发了属于自己的SSE4a多媒体指令集,并内置在Athlon II与Opteron等K10架构处理器中,不过SSE4a无法与Intel的SSE4系列指令集兼容。目前AMD新一代处理器已支持Intel的SSE4.1、SSE4.2指令集。

SSE5是AMD为了打破Intel垄断在处理器指令集的独霸地位所提出的,SSE5初期规划将加入超过100条新指令,其中最引人注目的就是三操作数指令(3-Operand Instructions)及熔合乘法累积(Fused Multiply Accumulate)。其中,三操作数指令让处理器可将一个数学或逻辑库,套用到操作数或输入数据。借由增加操作数的数量,一个x86指令能处理二至三笔数据,SSE5允许将多个简单指令汇整成一个指令,达到更有效率的指令处理模式。提升为三运算指令的运算能力,是少数RISC架构的水准。熔合乘法累积让允许创建新的指令,有效率地运行各种复杂的运算。熔合乘法累积可结合乘法与加法运算,透过单一指令运行多笔重复计算。透过简化代码,让系统能迅速运行绘图着色、快速照片着色、音场音效,以及复杂向量演算等性能密集的应用作业。目前AMD已放弃下一代Bulldozer核心内置SSE5指令集,改内置Intel授权SSE4系列指令集。

AVX(Advanced Vector Extensions)是Intel的SSE延伸架构,如IA16至IA32般的把寄存器XMM 128bit提升至YMM 256bit,以增加一倍的运算效率。

相关

  • 伊斯特汉普顿坐标:42°16′00″N 72°40′10″W / 42.26667°N 72.66944°W / 42.26667; -72.66944伊斯特汉普顿(英语:Easthampton)是美国马萨诸塞州汉普夏县的一个城市,面积35.2平方公里。根
  • 红松红松(学名:Pinus koraiensis)为松科松属的植物。海松(本草纲目),果松、韩松(东北),红果松(吉林),朝鲜松(中国裸子植物志)常绿乔木,高可达40米;小枝有绒毛;叶子粗而硬,5针一束;卵状圆锥形球果,种
  • 阿贡国家实验室阿贡国家实验室(英语:Argonne National Laboratory),位于美国伊利诺伊州杜佩奇县,是美国能源部下属的国家实验室。它是美国政府规模最大、历史最悠久的科研机构之一。实验室的前
  • 明智光秀明智光秀(1528年-1582年7月2日),出身于美浓国的土岐源氏支脉。通称十兵卫,雅号咲庵。其父明智光纲(日语:明智光綱)早逝,受叔父明智光安照顾。正室为妻木熙子(实为光秀第二任妻子),嫡男是
  • 蜀语蜀语,又称为巴蜀语、蜀方言,是西汉至元代流行于巴蜀地区(现中国四川省及重庆市一带)的主要语言,是古汉语的分支之一。由于明初与清初的两次“湖广填四川”大移民运动使巴蜀地区的
  • 大蒂顿国家公园大提顿国家公园(英语:Grand Teton National Park,或译大蒂顿国家公园)是位于美国怀俄明州西北部的一个国家公园。公园的名称来自于大提顿峰。大提顿峰标高4,199米,是提顿山脉的最
  • 三异丁基铝三异丁基铝(化学式:C12H27Al)是无色透明液体,用作顺丁橡胶聚合催化剂,也是其他定向聚合橡胶、合成树脂和合成纤维常用聚合催化剂。
  • 斯德哥尔摩证券交易所大楼斯德哥尔摩证券交易所大楼(瑞典语:Börshuset)位于瑞典斯德哥尔摩老城,为瑞典学院所拥有,是学院进行活动和颁布诺贝尔文学奖的地点,也是斯德哥尔摩证券交易所开展业务的场所。诺贝
  • 彰化县私立正德高级中学正德学校财团法人彰化县正德高级中学(Zen Del Senior High School,ZDVS),简称正德高中,位于彰化市莿桐里的私立完全中学。拥有国中、高中、高职等三种学制。正学培德普通科10班、
  • 水间百合子水间百合子(日语:水間 百合子/みずま ゆりこ ,1970年7月22日-),前日本足球运动员,日本国家女子足球队成员。出生于山形县。在1990年9月9日,她代表日本国家女子足球队出赛,在对战韩国