ASIC
Inferência
Hardware
IA
Custo Computacional

推理芯片和 ASIC:专业化战胜通用化

对于稳定负载的生产推理,TPU、Inferentia 和 LPU 等 ASIC 提供 GPU 无法比拟的效率。条件是知道你什么时候准备好专攻。

推理芯片和 ASIC:专业化战胜通用化

有一个令人舒服的假设主导着大多数人工智能基础设施决策:GPU 是人工智能芯片。如果您需要运行模型,则可以使用 GPU。这个推理具有历史价值——GPU 是使深度学习大规模可行的硬件,而云市场就是围绕它建立的。问题在于,这种假设已经成为一种习惯,而当针对您的特定负载有更有效的替代方案时,习惯的成本就会很高。

为什么 GPU 占主导地位以及为什么这种情况开始发生变化

GPU 凭借灵活性而非效率赢得了 AI 市场。它对于训练模型和推理都相当好地并行执行矩阵运算 - 当您还不知道主要负载是什么时,在两个不同领域之间相当好是一个优势。

当负载稳定时问题就开始了。训练一个大型模型是一个事件;为真实用户提供答案是一种连续、可预测和重复的操作。同样的计算,一天数十亿次。在这种情况下,GPU 的灵活性成为一种成本——您需要为不使用的通用容量、超出必要的能耗、为不再需要时的多功能性而设计的架构付费。

正是这一诊断导致最大的人工智能公司投资于专用推理芯片。这不是意识形态的赌注。这是大规模的按代币成本计算,不适用于 GPU。

每个专业架构解决什么问题

谷歌的 TPU v5p 诞生于一个具体问题:谷歌的基础设施处理推理的数量会使 GPU 成本变得不可持续。 TPU 专为低精度矩阵乘法而设计——这正是神经网络所做的——内存带宽针对这种访问模式进行了优化。如今,它可以在 Google Cloud 上使用,但在成为产品之前是为了内部使用而构建的,这表明了经济规模的重要性。

AWS Inferentia2 遵循类似的轨迹:每瓦性能比同等 GPU 高四倍,在到达 EC2 客户之前在 Alexa 和 Amazon 推荐系统的实际生产中进行了验证。实验室基准是一回事,实际流量压力是另一回事。

Groq 的 LPU 解决了一个不同的瓶颈。大多数人工智能芯片仍然遇到同样的问题:处理器速度很快,但内存无法以相同的速度提供数据。 Groq 创建了确定性执行,其中每个操作都在可预测的时间内发生,无需等待。结果是,在语言模型方面,文本推理速度大大超过了 GPU——不是因为芯片每秒执行更多操作,而是因为它消除了等待数据的停机时间。

Cerebras CS-3 解决了一些不同的问题。模型太大而无法安装在单个 GPU 芯片上,需要在多个芯片之间拆分,从而引入通信延迟。 Cerebras 将整个模型放置在单个晶圆大小的硅晶圆上,这是有史以来按面积制造的最大的计算机芯片。芯片之间没有通信,没有这个瓶颈。其局限性在于,很少有模型足够大,使得这种权衡有意义。

决定是否应该迁移的计算

GPU 和 ASIC 之间的决策逻辑比看起来更简单。在专业化有意义之前,需要对三个问题做出肯定的回答。

推理工作量稳定吗?如果您每个月都更改模型、尝试架构、测试假设,那么 GPU 的灵活性就是您所需要的,而其成本就是其代价。充电不稳定的专用芯片就是埋钱。

交易量是否已经足够高,使得每个代币的成本差异具有相关性? ASIC 的效率增益体现在规模上。在小批量中,差异被硬件摊销和操作复杂性所吸收。有一个交叉点(每个公司都不同),低于该交叉点 GPU 就更实用。

您是否已经在推理上投入了足够的精力来进行优化?从 GPU 改为 ASIC 会带来实际的运营成本:软件适应、结果验证、新的运营基础设施。该成本需要低于合理范围内预计的节省成本。

永久灵活性的陷阱

Inertia 有一个看似谨慎的叙述:“GPU 使我们能够在需要时灵活地更改模型。”这种说法在实验阶段是有效的,但当操作成熟时就会成为陷阱。您所支付的灵活性不再发挥作用 - 生产模型不会每周发生变化 - 但成本仍然存在。您正在为从未使用过的选项付费。

发生这种情况是因为在初始堆栈工作后很少重新考虑硬件决策。部署 GPU 的团队继续进行下一个项目。账单每个月都会收到,但没有人将当前每个代币的成本与专用芯片上的成本进行比较。缺乏审查不是理性——而是表面稳定的惰性。

提交之前要评估什么

并不是所有应该迁移的公司都会很快迁移,这并不一定是一个错误。 ASIC工具链的成熟度仍然低于GPU。 Groq 提供推理即服务,您无需操作硬件 - 它消除了很多麻烦。 Inferentia 需要在 AWS 环境中使用 Amazon 构建工具进行工作。 TPU 拥有最成熟的环境,但仅限于 Google Cloud。

对于大多数公司来说,最明智的决定不是完全迁移到 ASIC。它确定哪些推理工作负载足够稳定且足够大,足以证明专用芯片的合理性,将它们转移到最高效的环境,并维护 GPU 以适应仍在发展的情况。混合投资组合,基于负载而不是平台意识形态的决策。为了方便而采用全 GPU 的代价是永远支付灵活性费用——即使灵活性不再是您所需要的。

另请阅读

  • [专用芯片和通用CPU时代的终结0
  • [神经拟态和仿生计算:芯片何时开始向大脑学习1
  • [节能人工智能:更小、更便宜击败更大2
  • [边缘推理:在设备上运行人工智能比在云端更有意义3
  • [新一代芯片:GPU、NPU、ASIC 和 RISC-V,供谁决定4
  • [AI PC和NPU:当设备获得AI加速器时会发生什么变化5