每当出现一个承诺能够更快地运行人工智能的新 API 时,就值得将真正的能力与营销手册分开。 WebNN 是 Web Neural Network API 的缩写,是值得关注的领域之一,但也值得持怀疑态度。
该提案说起来很简单,但实现起来却很困难:为浏览器提供一种访问设备硬件加速(CPU、GPU,主要是 NPU)的标准化方式,以执行神经网络推理。 WebNN 提供了一个公共层,而不是每个 JavaScript 框架都重新定义如何与硬件通信。
在这篇文章中,我解释了它实际上是什么、它处于什么阶段,以及为什么你不应该把你的产品路线图押在它上面,即使你喜欢这个想法。
WebNN 是什么,用一句诚实的话来说
WebNN 是一个低级 API。这很重要:它既不是一个现成的模板库,也不是一个用户友好的框架。它公开了原始的神经网络操作(卷积、矩阵乘法、激活函数),并让更高层在此基础上构建推理图。
将其视为标准化驱动程序。 WebNN 的价值不在于手工编写,而在于在后台使用它来整合运行时以获得性能。
中心点是对 NPU 的访问。 NPU 是神经处理单元,是一种专用于人工智能运算的芯片,已经出现在大多数最新的手机和笔记本电脑中。如果没有标准 API,浏览器就无法一致地利用该芯片。 WebNN 试图解决这个问题。
规范处于什么阶段?
这是区分严肃分析和炒作的部分。 WebNN 被归类为 W3C 候选推荐草案,由 Web 机器学习工作组维护,于 2026 年 1 月更新。
翻译一下流程术语:候选推荐意味着该规范已经足够成熟,可以实施和测试,但还不是最终标准。它继续发展。细节可能会改变。
为了使 Web 规范成为综合建议,W3C 需要两个独立的实现来证明互操作性。 WebNN 尚未完全跨越这条线。它处于预览阶段,处于开发阶段,处于证明它在不同环境中同样有效的阶段。
作为一名技术领导者,我的解读很简单:WebNN 是用于监控和原型设计的技术,而不是用于放置在生产中的产品的关键路径上的技术。任何将预览视为 GA 的人都会将风险外包给最终用户。
成熟后实践会发生什么变化
假设规范稳定并可靠地到达浏览器。这个能解锁什么?
首先,性能。目前在 JavaScript 或纯 [WebAssembly0 上运行的模型现在使用设备的专用硬件。对于某些负载,在通用 CPU 和 NPU 上运行之间的差异是速度和电池消耗的数量级。
其次,浏览器中较小模型的可行性。我们并不是在谈论在 Chrome 选项卡中运行一个巨大的语言模型。我们谈论的是用于特定任务的紧凑模型,通常是量化的:图像分类、对象检测、本地转录、文本建议。 WebNN 提高了这些案例的经济性。
三是标准化。如今,那些想要在浏览器中加速的人依赖于并不总是可移植的不同路径。通用 API 减少了碎片化,并为在其上构建的人员提供了可预测性。这是最被低估的结构性收益,因为标准化可以将噱头变成平台。
WebNN 融入生态系统的位置
WebNN 不与推理运行时竞争,而是为推理运行时服务。最具体的案例是 ONNX Runtime Web,它可以使用 WebNN 作为执行后端。您继续使用运行时抽象,而 WebNN 则负责与硬件对话的脏活。
这种设计是健康的。这意味着应用程序开发人员很少会直接接触WebNN。它将使用顶层,决定是否利用 WebNN、WebGPU 还是后备。为了更深入地理解这种安排,值得阅读[浏览器内人工智能和本地推理1],其中涵盖了更广泛的运动。
实际结果是,即使您从未编写过 WebNN 的任何一行,WebNN 对您的架构也很重要。它定义了运行时可以达到的性能上限。
WebNN、WebGPU 和 WebAssembly 不是一回事
有必要澄清一个常见的混淆,因为这三个首字母缩略词共存并且经常混淆。 [WebAssembly2 是浏览器中的一种低级代码执行格式,速度很快,但在 CPU 上运行。 WebGPU 公开 GPU 用于通用计算,包括推理。 WebNN是神经网络特有的,主要针对NPU。
实际差异在于专业化。 WebGPU 功能强大但通用:您描述计算,它在显卡上运行它。 WebNN 知道它正在处理神经网络图,并且可以将操作映射到可用的最高效的硬件(无论是 GPU 还是 NPU),而应用程序不需要知道是哪一个。
成熟的运行时会选择每个设备上的最佳可用路径。如果有带有 NPU 的 WebNN,那就太好了。如果没有,则由 WebGPU 负责。如果没有,请在 CPU 上使用 WebAssembly。这种后备级联使得浏览器内推理在如此异构的设备群中可行,也是不将代码直接与 WebNN 绑定的另一个原因。
我建议现在做什么
不要重写任何东西。成熟的建议是在产品之外建立一个独立的概念验证,以衡量受众设备上的实际性能提升。测量的数字比规格承诺更有价值。
监控浏览器支持作为市场信号,而不是采用触发器。当两个独立的实现稳定并且用例适合小模型时,对话就会改变基调。
并对范围保持怀疑。浏览器内人工智能并不神奇,也不会取代服务器端的所有推理。它是一个有明显局限性的工具:用户硬件各不相同,大型模型不适合,并且客户端模型的维护有其自身的成本。将其视为一个工程过程,并进行治理和衡量,这就是负责任的采用与冒险的区别。
如果您领导技术或产品并将推理映射到设备,请从正确的问题开始:在用户设备而不是服务器上运行哪个特定问题最能解决? WebNN 可能是其中一些问题的答案,但不是全部。您想就它在您的环境中的意义进行交流吗?打电话给我。
来源:规范 [Web 神经网络 API (WebNN),W3C4。
另请阅读
- [WebNN 和 ONNX Runtime Web:浏览器中的加速推理堆栈5
- [浏览器中的人工智能:为什么要在用户设备上运行推理6?
- [量化模型:在浏览器中运行人工智能的关键7
- [端侧AI:服务器与端侧的战略决策8
- [软件开发中的人工智能代理:采用治理9
- [反AI Slop:为什么人类内容的需求不断增长10
