英特尔、AMD、英伟达这三大“芯片巨头”在GPU市场上的格局悄然发生变化。
英特尔已经涉足GPU领域数十年,从其首款 iGPU 到该公司如今在市场上推出当前专用显卡。它比其竞争对手 AMD 和英伟达领先多年,目前主要在低价格范围内与竞争对手竞争。
英特尔、AMD、英伟达三大GPU架构有何不同?
(资料图片仅供参考)
众所周知,英伟达使用所谓的 SM 或流式多处理器,而 AMD 称其为 CU 或计算单元。在英特尔的架构中,它可以在某些架构或矢量引擎上显示为执行单元或 EU 。
要了解 英特尔GPU 与其对手在组织或架构上的差异,有必要从这些执行单元开始,它们将是基本的着色器单元。这些单元被设计为小型处理器或矢量 FPU 单元以添加传输线脉冲发生器(TLP)。
也就是说,它们不仅仅是一个简单的计算单元,它们还有一些额外的组件,比如它们自己的控制单元,它们自己的寄存器,以及它们对应的执行单元。最终,它们更像是一个 CPU 内核,而不是一个简单的 FPU。事实上,我们可以看到在英特尔的架构中使用了4个FP32 FPU,即单精度浮点或32位,作为SIMD或向量单元工作。我们还有其他 4 个用于整数交换的 ALU,它们支持 SIMD over register。
由于它对寄存器进行操作,即计算单元被细分,因此每个时钟周期可以处理两倍的操作数。例如,可以使用 FP32,但也可以同时使用两个 FP16 或每个周期使用四个 FP8。这就是 Shader 程序的运行方式。
另一方面,Raja Koduri 对 英特尔Xe 的影响也很受欢迎。前者来自 AMD 的图形部门,在执行单元方面采用了与英特尔类似的理念,因为它们是双重的,并且每两个 EU 共享相同的控制单元。也就是说,与我们在 AMD 的 RDNA 架构中看到的非常相似,正如您在上一张图片中看到的那样。
至于英伟达,它的CUDA核心分别比英特尔和AMD的EUs和CUs简单得多,但包含了更多这样的单元。在英伟达的情况下,CUDA 基本上是着色器单元,基本上是 32 位浮点和整数单元:
正如我们在上一节中看到的,专门用于处理着色或着色器的执行单元被划分为子切片,它们在 英特尔Xe GPU 的 EU 内分组。
英特尔所说的子切片由内部的 16 个 EU 组成,对于 FP32 总共转换为 64 个 FPU,对于 32 为整数总共转换为 64 个 ALU。这使得这些子部分在原始功率方面类似于 AMD 计算单元。然而,它们并不完全是副本,英特尔GPU 处理的 ISA 将与 Radeon 的不同。
Sub-Slice或基本着色器单元内部是 GPU 中通常存在的部分,尽管英特尔使用与其竞争对手不同的命名法。例如,我们发现:
来源:算力基建