Inferência Local
Inteligência Artificial
Navegador
Privacidade
Edge AI

浏览器中的人工智能:为什么在用户设备上运行推理

浏览器中的本地推理运动向架构决策者解释了:隐私和成本收益,以及该方法在哪里达到了上限。

浏览器中的人工智能:为什么在用户设备上运行推理

默认情况下,当我们谈论产品中的人工智能时,我们会想象对服务器的调用。用户输入内容,数据通过网络传输,大型模型在远程计算机上处​​理它,然后返回响应。这种设计有效、可扩展并主导市场。但这并不是唯一的一个。

在用户自己的设备上、在浏览器内运行推理而无需将数据发送到任何地方的趋势正在不断增长,并且技术上合理。这就是本文的主题:它是什么、为什么重要以及它在哪里不再有意义。

我会将这个话题视为工程,而不是趋势。问题不在于这是否是未来,而在于今天在哪些特定情况下关闭账户。

本地推理在浏览器中意味着什么

推理是已训练模型根据输入生成答案的步骤。训练模型既昂贵又麻烦。根据具体情况,从小模型运行推理足够轻,可以在设备上进行。

浏览器中的本地推理意味着模型在用户的机器上加载并执行,使用设备自己的CPU、GPU或NPU。输入数据不是从那里出来的。响应是在客户端上计算的。

这不是异国情调。建议下一个单词的文本校正器、识别照片中面孔的过滤器、离线运行的音频转录:所有这一切都可以在没有推理服务器的情况下发生。

证明这一努力的四个理由

首先是隐私。如果数据不离开设备,则敏感信息不会通过网络传输或存储在第三方服务器上。对于某些类别的数据,这不再是一种便利,而是成为一种要求。

第二是延迟。互联网上没有来回的情况。响应实际上是瞬时的,仅受本地处理的限制。对于实时交互,例如打字时的建议,这种差异决定了体验是否流畅或卡住。

第三是成本。服务器端推理按每次调用定价。每个请求都会消耗付费 GPU,增加账单并随着用户数量的增加而增长。本地推理将此处理卸载到用户已有的硬件上。推理的边际成本下降到接近于零。

四是线下工作。即使没有连接,浏览器中加载的模型也会继续响应。对于需要在不稳定的网络或断开连接的环境中运行的应用程序来说,这是一个很难在服务器上复制的设计优势。这组属性直接体现了[本地优先0]理念,该理念将设备置于中心位置。

这在实践中是如何运作的

使这种情况成为可能的部分是在浏览器中运行的推理运行时。目前最成熟的一个是 ONNX Runtime Web。它以 ONNX 格式加载模型并在客户端上运行它们,使用 [WebAssembly1?、WebGPU 以及成熟的 WebNN 来访问硬件加速。

概念流程是直接的。您训练或获取模型,将其转换为运行时可以理解的格式,优化大小和准确性,并将其加载到 Web 应用程序中。从那里开始,推理发生在本地。

使这一可行的趋势是小型变压器。紧凑模型通常是从​​较大模型中提取出来的,然后进行量化以占用更少的内存,可以适合合理的下载并以可接受的性能运行。它们在容量上不与巨型模型竞争,但它们可以轻松解决明确定义的任务。要理解这种压缩,有必要了解[浏览器中的量化模型2]。

该方法达到上限的地方

这就是我更愿意明确而不是乐观的地方。浏览器中的本地推理有具体的限制,忽略它们会让人感到沮丧。

大型号不适合。具有数十亿参数的模型无法在通用浏览器选项卡中下载或运行。那些需要前沿模型能力的人将继续依赖服务器。没有任何技巧可以绕过物理和记忆。

用户硬件差异很大。最近配备专用 NPU 的笔记本电脑和旧手机为同一型号提供了截然不同的体验。您正在构建异构设备群,但无法对其进行控制。在一台机器中飞翔的东西在另一台机器中会窒息。

还有初始下载费用。加载模型,即使是小且量化的模型,也意味着在第一次使用之前下载兆字节。这会影响第一次体验,并且需要缓存和加载策略。

并且有维护。客户端模型需要进行版本控制、更新和分发。解决模型中的问题意味着将新版本推送到所有设备,以及随之而来的所有部署复杂性。

还有一个不太明显的限制:[可观测性3。当推理在服务器上运行时,您可以看到一切、测量质量、检测性能下降并进行调整。当它在用户的设备上运行时,这个反馈循环变得更加不透明。如果不收集遥测数据,您就无法看到输入或结果,并且收集有关您选择保留本地的某些内容的遥测数据可能与选择它的原因相矛盾。这是隐私和改进模型的能力之间真正的紧张关系,它需要有目的地设计,而不是事后发现。

如何在本地和服务器之间做出选择

选择不是意识形态的,而是情境的。小型、隐私敏感、延迟敏感或需要离线的任务是本地处理的自然候选者。需要大型模型、集中控制或频繁更新的任务最好在服务器上完成。

最成熟的绘画很少是纯粹的。许多产品将两者结合起来:在常见情况下使用本地模型进行快速、私密的响应,在任务要求更高时升级到服务器。经过深思熟虑的混合体通常会战胜双方的纯粹主义。

重要的是将此视为具有明确标准的架构决策,而不是时尚的采用。产品中的人工智能是流程、数据治理和结果衡量。浏览器只是在桌面上打开了另一个选项。

一个经常被忽视的细节:本地推理改变了计算费用的支付者。在服务器上,成本由您承担,并随着产品的成功而增长。在设备上,电池和处理方面的成本由用户承担。这听起来很棒,直到您记得电池耗尽并且手机变热。每次触摸时运行的优化不佳的模型都会默默地降低体验,用户会在不知道为什么的情况下感觉到它。这里的优化并不是奢侈,而是对体验的要求。

如果您正在考虑将部分推理转移到用户的设备上,那么最好的第一步是进行测量:采用最简单的用例,使用小型模型运行概念验证,并测量受众设备上的实际性能。想讨论一下您的情况是否合适?我在这儿。

另请阅读

  • [端侧AI:服务器与端侧的战略决策4
  • [WebNN:为浏览器带来硬件加速的 API5
  • [量化模型:在浏览器中运行人工智能的关键6
  • [WebNN 和 ONNX Runtime Web:浏览器中的加速推理堆栈7
  • [边缘推理:在设备上运行人工智能比在云端更有意义8
  • [什么是合成数据以及为什么它对领导者很重要]9