云市场多年来一直热销的一种说法是商品化:底层的硬件并不重要,重要的是服务。您根据托管服务目录、每个实例小时的价格和支持来选择提供商。该芯片是一个基础设施细节,不可见且可互换——虽然每个人都从英特尔和 AMD 购买相同的芯片,但真正的区别在于软件和操作,这很方便。问题是这种说法不再正确,以前理解这一点的提供商正在获得其他人无法承受的好处。
当你可以购买芯片时为什么要构建自己的芯片
直接的答案是:因为在超大规模的情况下,硬件效率会转化为利润数字,从而证明任何合理的研发投资都是合理的。 AWS 处理的计算量使每瓦特的任何百分比增益每年都与数亿美元相关。如果专为您的工作负载设计的芯片比现成的同等芯片的每瓦性能高 20%,那么这种差异就不是技术上的好奇心,而是转化为价格、利润或两者兼而有之的竞争优势。
第二个原因是独立性。任何从单一供应商购买所有计算能力的人——就人工智能而言,主要是从英伟达购买——都受到分配队列的约束,价格由对产品拥有实际垄断权的人决定,以及另一个人的技术路线图。对于一家从事云计算竞争的公司来说,这是一种与依赖单一客户相同的战略风险。委员会中没有人会容忍第二次;第一个变成了例行公事,直到大型科技公司决定自己生产。
每个超大规模玩家如何玩这手牌
AWS Graviton 是最具可读性的业务决策案例。与 AWS 本身上的同等 x86 实例相比,Graviton4 基于 ARM,可显着提高性能,AWS 利用这一点来降低内部成本,并为迁移客户提供更便宜的实例。采用率之所以不断增长,是因为价值主张是可量化的:您运行相同的工作负载并支付更少的费用,或者以相同的价格运行更多的工作负载。
谷歌在 TPU 方面做出了最激进的举动。张量处理单元是针对特定工作负载从头开始设计的:高维矩阵乘法,这是神经网络的核心运算。 TPU v5p 用于训练和推理,与 TensorFlow 和 JAX 深度集成。对于任何考虑使用它的人来说,相关细节是:TPU 并不是作为孤立的硬件而存在。您可以通过 Google Cloud 访问容量 - 采用 TPU 是一个平台决策,而不仅仅是一个计算决策。绩效与债券挂钩。
苹果是垂直整合最极端的例子,也是最古老的例子。从M1开始,苹果就控制了芯片、操作系统、编译器和系统软件。实际结果是,在碎片堆栈中不可能进行的优化变成了例行公事——芯片知道缓存,操作系统知道芯片,编译器知道两者。 M4 Ultra 在台式机外形中实现服务器性能并非依靠单一的工程奇迹,而是因为每一层都是为其他层而设计的。
Meta 和微软后来带着更多外科手术目标到来。 Meta 的 MTIA 旨在减少对 Nvidia 专门推荐模型的依赖——每天以足够稳定的标准进行数十亿次推理,足以证明专用芯片的合理性。 Microsoft 的 Maia 100 涵盖了 Azure 上的训练和推理,包括一些 GitHub 基础设施 [Copilot0。在这两种情况下,目标都不是完全取代 GPU,而是在可预测的负载使专业化在经济上显而易见的情况下减少依赖。
芯片作为护城河:为什么很难复制
定制芯片具有持久优势的原因在于复制的成本和时间。在第一块晶圆出厂之前,设计一款有竞争力的芯片需要数年时间。大规模制造需要与台积电或三星建立关系,这种关系不是在几个季度内建立起来的。充分利用芯片的软件生态系统需要更长的时间。无论谁在 2016 年起步——谷歌推出了 TPU,苹果推出了过渡芯片——在最好的情况下,决定明天起步的竞争对手在 2030 年之前都无法达到这样的地位。它不是可以通过投资回合购买或在产品冲刺中复制的优势。
对于规模较小的云提供商来说,这会带来竞争问题,而且没有明显的解决方案。你可以购买与竞争对手相同的 Nvidia 或 AMD 芯片,但你买不到 Graviton 经过多年全面迭代后赋予 AWS 的效率。每代人的性能差距都在扩大,而且没有捷径可走。
这对于使用云的人(而不是销售云的人)来说有什么变化
对于那些使用云服务的人来说,最相关的变化是实例性能基准失去了一个维度。将不同提供商之间的 vCPU 和 GB RAM 进行比较(就好像底层硬件相同一样)是一种不完整的分析。 AWS Graviton 实例和等效的 AWS x86 实例是不同芯片上的不同工作负载,其性能标准因应用程序类型而异。
第二个变化是云锁定获得了原始合同中没有的硬件层。针对 TPU 优化的应用程序的迁移成本比针对通用计算的应用程序高得多。这并不是要避免使用专用芯片的理由——性能通常证明这一点是合理的——但在采用之前而不是之后的分析中需要考虑成本。
第三个方面是提供商之间的成本和性能差异将会扩大。 Graviton 已经使 AWS 上的某些负载比现成的硬件替代品便宜得多。随着每个超大规模企业的芯片不断成熟,比较云将需要了解哪个芯片支持哪个工作负载——当今许多公司将技术知识委托给待命的集成商,但没有意识到他们也将决策委托给了提供商。
另请阅读
- [推理芯片和 ASIC:当专业战胜通用1
- [专用芯片和通用CPU时代的终结2
- [边缘计算:为什么计算正在离开云而向数据靠拢3
- [硅地缘政治:为什么芯片战争对于那些决定技术的人来说很重要4
- [边缘推理:在设备上运行人工智能比在云端更有意义5
- [基础设施作为竞争优势:初创企业向科技巨头学习了什么6