人工智能决策很快转变为架构决策,而架构决策又转变为成本、风险和合规性。因此,在服务器或用户设备上进行推理的选择不应委托给项目结束时进行。它从一开始就塑造了产品。
这篇文章是写给那些做出决定的人的。技术负责人、产品负责人、CTO。基本问题是实际的:什么时候在用户设备上而不是在其基础设施上运行人工智能才有意义?这会带来什么成本?
我将把这个主题视为一种权衡,因为这正是它的本质。没有通用的右侧。右侧是用例、受众和风险概况。
业务方面的权衡
在服务器上运行可以让您进行控制。您选择模型,随时更新它,观察发生的情况,测量和调整。您可以使用大型前沿模型,其容量是任何用户设备都无法容纳的。这种自由的代价是双重的:您为每次推理调用付费,并且用户的数据需要传输到您的机器。
在设备上运行它会颠倒这个等式。由于处理使用用户的硬件,推理的边际成本降至接近于零。数据不会离开设备,这改变了有关隐私的讨论。并且该应用程序可以离线工作。这里的价格就是限制:您受到设备容量、适合设备的模型以及维护分布式模型的复杂性的束缚。
总结一下核心张力:服务器是以金钱和数据流量为代价的控制和容量。设备隐私、零推理成本、以节流和碎片为代价离线。 [浏览器内 AI 和本地推理0] 详细介绍了此场景的技术概述。
当费用改变账单时
财务方面的争论值得诚实的关注。服务器端推理随着使用情况而扩展。用户越多、调用越多,GPU 费用就越高。对于一个拥有许多活跃用户和每个会话有许多人工智能交互的产品,这个数字会急剧增长。
设备上推理将此成本转移到用户已购买的硬件上。对于频繁的小任务,这可能是单位经济关闭和每次迭代都会损失资金之间的区别。
但要小心幼稚的阅读。您可以用推理成本换取工程成本:转换、优化、量化、版本控制和分发客户端模型并不是免费的。当推理量足够高以稀释固定工程成本时,就会出现增益。在小批量产品中,服务器总体上通常更便宜。
与 LGPD 和敏感数据的连接
在我看来,这是关于设备端最有力且最被低估的论据。当数据不离开设备时,大部分合规性问题就不会出现。
[LGPD1 特别严格地对待敏感数据类别:健康、生物识别、儿童数据、需要强有力的法律依据和仔细处理的信息。每次这些数据传输并存储在您的基础设施中时,您都承担责任、泄漏风险和保护义务。
局部处理会减少该表面积。如果推理发生在设备上并且数据未传输或保留在服务器上,则可以最大限度地减少收集和保留的内容,这是法律本身的核心原则。对于医疗保健和政府等行业来说,敏感数据是常态而不是例外,因此在设备上进行处理可能是真正的合规优势。
这不是灵丹妙药。客户端模型仍然需要小心,而且义务也不会消失。但减少敏感数据的传输和存储是降低监管风险的最有效方法之一,因为保护数据的最佳方法不是将其放在您的服务器上。
信任论也适用。能够以技术诚意告诉用户,对他们的照片或健康信息的分析不会离开设备,这是一个强有力的产品信息。在隐私敏感的市场中,这不再是一个工程细节,而是成为一个竞争优势和品牌叙事。
在设备上选择时您所承担的风险
成熟的战略决策会从下面考虑成本,而不仅仅是从上面考虑收益。设备上推理存在三个需要讨论的风险。
首先是硬件碎片化。您的受众使用具有截然不同功能的设备。有些是专用 NPU,有些是旧硬件。同样的功能提供了不平等的体验,而且你无法控制这个公园。这迫使您计划回退,而回退通常也意味着维护服务器路径。
二是支持不成熟。大多数支持浏览器加速的 API 仍在不断发展。 [例如,WebNN2 仍处于 W3C 预览阶段,尚未推荐用于生产。在不稳定的基础上构建意味着需要返工。
三是模型维护。更新服务器上的模型很简单:您更改它即可。更新分布在数百万设备上的模型是一个部署问题,其中存在版本共存、缓存失效以及用户处于不同状态的问题。这种运营成本是持续的、无声的,而且在规划中很容易被低估。
在实践中如何做出决定
我使用一个简单的分层过滤器。首先,数据的性质。如果它是敏感且受监管的,那么设备上的合规性就会增强。其次,所需模型的尺寸。如果任务需要大的模型容量,服务器几乎是必须的。第三,推理量。由于经济性,大容量有利于该设备;由于其简单性,低容量有利于服务器。
实际上,最常见的答案是混合。针对频繁、私密和延迟敏感的情况的本地模型,当任务需要更多容量时升级到服务器。这需要一个知道如何在运行时决定在哪里运行每个东西的架构。这需要付出努力,但它集两全其美,而又不将产品束缚于一个极端。
我不建议你随波逐流。产品中的人工智能是流程、数据治理和结果衡量,而不是流行语竞赛。决定一切的问题是:通过改变推理发生的地点,你能最好地解决哪个具体问题?如果你不能明确回答,说明你的决定还没有成熟。
如果您正在设计产品的人工智能架构,并希望在成本、合规性和风险标准之间进行权衡,那么这种对话值得在编码之前尽早进行。打电话给我讨论你的案子。
另请阅读
- [浏览器中的人工智能:为什么要在用户设备上运行推理3?
- [WebNN:为浏览器带来硬件加速的 API4
- [什么是合成数据以及为什么它对领导者很重要5
- [生成式用户界面需要更多的治理,而不是更少66
- [量化模型:在浏览器中运行人工智能的关键7
- [WebNN 和 ONNX Runtime Web:浏览器中的加速推理堆栈8
