Inferência
Edge AI
On-device
Privacidade
Latência

边缘推理:在设备上运行人工智能比在云端更有意义

本地推理并不是云的二流替代品——就延迟、隐私和大规模成本而言,该设备已经在几种具体情况下获胜。

边缘推理:在设备上运行人工智能比在云端更有意义

云端AI推理是默认路径。您可以在强大的 GPU 上训练模型,托管端点,并在应用程序需要响应时调用 API。它是一个干净的架构,有良好的文档记录并且具有良好的工具覆盖率。问题在于,这个前提带有一个不言而喻的假设:网络延迟是可以接受的,隐私可以委托给第三方,每次调用的成本不会随着使用量的增加而激增。当您仔细检查这三个假设时,您会发现云在更多情况下并不是显而易见的选择。

为什么延迟是第一个真正的问题

通过 API 的 LLM 响应通常需要 300 毫秒到 2 秒,具体取决于模型大小、服务器负载和用户连接质量。对于许多应用程序来说,这个时间是可以接受的。对于其他人来说,这是致命的。

考虑一下汽车中的语音助手、工业设备中的手势识别系统,或者数据覆盖不稳定地区的医生使用的实时翻译应用程序。在所有这些情况下,等待数据包传输到数据中心并返回并不是一个次要的操作限制——它是产品是否真正有效的决定性因素。局部推理消除了这条路径。该模型在设备自己的芯片上运行,响应在数十毫秒内出现,并且没有网络状态线进入等式。

隐私是一种竞争优势,而不仅仅是合规性

当您将数据发送到云进行推理时,您正在将潜在的敏感信息传输到第三方服务器。这包括用户输入的内容、他们所说的内容以及相机看到的内容。即使拥有可靠的数据处理合同和 SOC 2 认证,业务用户或监管机构会问的问题也很简单:这些数据是否会离开设备?

根据局部推理,答案是否定的。该模型处理用户硬件上的所有内容。没有包裹上涨。对于卫生、金融、法律和国防等行业来说,这一特征不是营销差异,而是技术合同要求。为这些市场构建产品并忽略本地推理的公司实际上将自己排除在需要数据主权的合同之外。

该逻辑也适用于最终用户。在本地处理文本的预测键盘应用程序、从不同步对话历史记录的个人助理、离线运行的文档分析工具——它们都在响应那些不希望数据流经他们无法控制的基础设施的人们的真实需求。

无需讨论,云仍然获胜

战略诚实需要认识到设备的局限性。 GPT-4 无法在 iPhone 上运行。拥有数十亿个参数的最先进的模型需要大量的内存和计算能力,而目前消费类硬件中根本不存在这些内存和计算能力。云仍然是您可以运行最强大的模型而不影响响应能力的唯一地方。

更新灵活性也对云端造成影响。当您远程提供模型时,您可以更新权重、切换版本或修复行为,而无需分发新版本的应用程序。通过本地推理,模型以二进制形式打包。更新意味着新版本的发布,包含商店审核、下载和逐步采用的所有成本。

本质上已经异步的任务——生成报告、合成长文档、对大量文本进行复杂推理——不会受到网络延迟的影响,并受益于云不受限制的计算能力。将这些负载强制加载到设备上会在错误的点上进行优化。

规模成本是计算的重点

对于较小的推理量,每次 API 调用的成本可以忽略不计。对于拥有数百万活跃用户且每个会话运行数十次推理的产品,每月的成本开始与工资竞争。这不是一个假设的预测——拥有人工智能密集型生产力应用程序的公司今天已经面临这个问题。

本地推理将操作成本转移到用户的硬件上。该模型在设备的处理器上运行,您支付的是二进制文件的大小,而不是推理量。对于每次会话使用量较高且可预测的产品,这种权衡从根本上改变了成本结构。一旦安装了应用程序,每个额外响应的边际成本就会降至零。对于构建利润微薄的产品的团队来说,这不是一个架构细节,而是一个业务模型决策。

工具链和具体决定标准

局部推理工具已经足够成熟,可以在新项目中认真考虑。 Apple 的 CoreML 编译模型以在 iOS 和 macOS 设备上使用神经引擎加速运行。 ONNX 运行时可跨平台移植,并支持积极的模型量化,从而减少大小和内存消耗,而不会严重损失准确性。 TensorFlow Lite覆盖Android,具有良好的运行覆盖率和GPU加速能力。 MediaPipe 为计算机视觉和音频处理提供现成的管道,并针对移动设备进行了优化,无需团队重新设计流程的每个步骤。

云和设备之间的选择很少是二元的。最强大的架构通常是混合架构:更小、更快的模型在本地运行,以实现即时和频繁的交互,而需要更大模型的任务则在存在连接时异步委托给云。决策标准涉及三个具体问题:响应时间以毫秒为单位重要吗?处理后的数据不能离开设备吗?推论量是否会使 API 成本与产品成本结构相关?如果对其中任何一个的答案是肯定的,那么本地推理应该成为桌面上的第一个选项,而不是网络发生故障时的应急资源。

另请阅读

  • [浏览器中的人工智能:为什么要在用户设备上运行推理0
  • [推理芯片和 ASIC:当专业战胜通用1
  • [工厂中的边缘计算:本地处理更有意义2
  • [端侧AI:服务器与端侧的战略决策3
  • [边缘计算:为什么计算正在离开云而向数据靠拢4
  • [节能人工智能:更小、更便宜击败更大5