规模总是获胜的前提受到数据而不是理论的挑战。 Mistral 7B 于 2023 年推出,参数略多于 70 亿个,在推理和代码基准测试中超过了 130 亿个 LLaMA 2。微软的 Phi-3 Mini 拥有 38 亿个参数,可在逻辑和数学任务中匹配十倍大的模型。所发生的事情并不是基准事故——而是语言模型针对特定任务的训练、提炼和优化方式的结构性变化。该行业多年来一直在追求参数的下一个数量级。现在,竞争发生了逆转:谁在特定任务中找到具有相同质量的最小模型,谁就在成本、延迟和能耗方面获胜。
通用秤的神话
大型模型背后的争论一直是一种泛化:具有数千亿个参数的模型可以回答从法律问题到用 Rust 生成代码的所有问题,而无需任何额外的配置。这个论点对于一般用途是有效的——但大多数商业应用程序不需要一般用途。使用人工智能对医疗记录进行分类的医疗保健提供者需要临床准确性并遵守医学术语。自动化信用分析的银行需要结构化的数字推理。生成产品描述的电子商务平台需要在固定格式内控制创意。在这些情况下,专门的 70 亿参数、域调整模型的性能始终优于通用 GPT-4,而且每次调用的成本只是其一小部分。
规模叙述的问题在于它将最大容量与运营效率混合在一起。一级方程式赛车比皮卡车快,但不适合运载货物。正确的问题不是“哪个模型更好”,而是“哪个模型足以以最低的每次推理成本完成此特定任务”。
效率工具箱
量化是最容易实现的技术:将模型权重的数值精度从 32 位降低到 8 位、4 位,甚至 2 位。权重为 float32 的模型占用的内存是 int8 中相同模型的四倍,对于大多数实际任务来说,质量损失低于明显的阈值。 4 位量化已成为设备上运行的模型的标准 - 它允许您在 MacBook Pro 上运行 80 亿参数的 Llama 3,而无需任何云加速。
知识蒸馏是一种不同的、更强大的关键任务方法:训练一个小模型来模仿大模型的行为。大模型充当“老师”——它生成数据集的输出概率,而小模型学习重现这些分布,而不仅仅是正确或错误的标签。结果是,蒸馏模型吸收了较大模型中不会出现在数据直接训练中的推理模式。 Microsoft 的 Phi-3 的训练方式与此完全相同:精选高质量数据加上大型模型的提炼。神经网络修剪完成了这三重奏——识别并删除对最终输出影响不大的连接,在不完全重新训练的情况下减少参数。稀疏模型探索了一个相关的想法:它们不是激活每个标记的所有参数,而是根据输入的性质激活专门的子集。 Mixtral 使用这种专家混合架构,总共拥有 460 亿个参数,但每次调用仅激活 120 亿个参数——模型质量较高,模型成本中等。
证明投资合理性的算术
生产中的推理成本遵循一个简单而残酷的逻辑。如果调用 GPT-4 的费用为每千个代币 0.30 雷亚尔,并且您每天处理 1 亿个代币,则每月费用将超过 90 万雷亚尔。针对特定任务的同等质量的专门模型,在您自己的基础设施或更便宜的 API 上运行,每千个代币的成本可能为 0.03 雷亚尔 - 减少十倍。这种差异并不是微不足道的。从规模上看,这就是盈利产品和流失现金的产品之间的区别。
除了直接的 API 成本之外,还有延迟成本。较大的模型需要更长的时间来响应——不仅仅是因为它们处理更多的参数,还因为运行它们所需的基础设施涉及更多的 GPU 内存、更多的芯片间通信和更多的 IO 瓶颈。对于延迟很重要的应用程序(实时聊天、自动完成、实时推荐系统),速度提高 5 倍的模型不仅更便宜。这是一个更好的产品。效率将这两个向量放在等式的同一侧。
通过软件倍增增益的硬件
软件模型的效率存在物理限制。硬件增益是结构性优势的体现。 NVIDIA A100 和 H100 等通用 GPU 专为训练工作负载而设计,即高精度的密集矩阵运算。推理具有不同的配置文件:许多并行的小请求、加载到内存中并重用的权重、每次调用需要低延迟。对于这种配置,专用芯片可提供通用 GPU 无法比拟的效率。
Apple Silicon——M1、M2、M3,现在是 M4——是最终用户最明显的例子。统一内存架构,CPU、GPU和神经引擎访问相同的高带宽内存池,消除了传统架构中影响效率的数据传输瓶颈。这就是为什么在 MacBook M3 Pro 上运行 70 亿参数模型不仅可行,而且性能卓越。谷歌的 TPU 和 AWS 的 Trainium 和 Inferentia 芯片都是同一原理的数据中心版本:为特定工作配置而不是一般用途而设计的芯片。 Cerebras 更为激进——它构建了整个晶圆大小的芯片,消除了芯片间通信,并提供了 GPU 集群在相同功耗下无法实现的推理吞吐量。实际结果:专用芯片上每个代币的能源成本比通用 GPU 低 3 到 10 倍。当您结合在专用芯片上运行的更高效模型时,收益会成倍增加,而不是相加。
2026年每个技术团队都会面临的决定
通过 API 使用前沿模型还是投资更高效的专业模型之间的选择不是技术性的,而是战略性的。并且有明确的参数。当推理量较低、任务需要广泛泛化、团队没有能力维护 ML 基础设施时,或者当实验速度超过成本优化的需要时,通过 API 进行前沿建模就有意义。对于测试假设的早期初创公司来说,为每个代币支付更多费用是快速学习的正确成本。
当数据量增长时,当任务稳定并重复时,当领域足够具体以至于微调或提炼带来可测量的增益时,或者当数据足够敏感以至于本地运行成为合规性要求而不是偏好时,计算会发生变化。投资微调的决定通常涉及三个问题:基本模型是否已经在不进行定制的情况下达到了 80% 的预期结果?是否有足够多的领域数据使得拟合有意义——大约有数以万计的精选示例? Inference Volume 是否能在六个月内收回投资?如果这三个答案都是肯定的,那么这条路就很明显了。最常见的错误是在基本模型已经足够好的情况下进行微调,或者在推理成本很久以前就证明了努力的合理性时不进行微调。值得一提的第三种方法是使用前沿模型作为蒸馏的预言机 - 生成高质量的合成数据并使用该数据来训练您自己的较小模型。该策略将大型号的质量与小型号的运营成本结合起来。
另请阅读
- [神经拟态和仿生计算:芯片何时开始向大脑学习0
- [推理芯片和 ASIC:当专业战胜通用1
- [人工智能能源与主权:政府现在需要规划什么2
- [人工智能能源危机:数据中心消耗对基础设施决策者意味着什么3
- 【能源,人工智能新石油:谁掌握了资源,谁就掌握了时代4
- [边缘推理:在设备上运行人工智能比在云端更有意义5
