AI晶片的「去Nvidia化」:梦想、现实与成本曲线


生成式人工智能热潮把Nvidia推上算力王座,也令全球科技企业产生同一焦虑:当最重要的生产工具由单一供应商掌握,晶片价格、交付周期和议价权便难以控制。因此,Google扩大TPU部署,亚马逊推进Trainium,微软、Meta等亦投资自研晶片;AMD则以Instinct系列正面挑战。市场遂出现「去Nvidia化」想像,仿佛只要推出另一款加速器,便能打破其垄断。

现实却复杂得多。Nvidia的护城河从来不只是一块GPU,而是由CUDA软件、开发工具、模型函式库、高速互连、伺服器架构及工程人才组成的完整系统。企业购买的不是晶片规格,而是把模型快速训练、部署及持续升级的能力。若转用其他平台,即使晶片单价较低,也可能要重写程式、重新测试模型、培训团队,甚至调整数据中心网络。算力便宜了,上市时间却延后半年,对AI竞赛中的企业而言,代价可能更高。

真正竞争不在晶片价格,而在每个Token成本

替代者并非没有机会。AMD的MI300X配备192GB HBM3记忆体,较适合大型模型推理及记忆体密集型工作;Google第六代TPU Trillium的单晶片峰值运算能力较TPU v5e提高4.7倍,能源效率提升超过67%;AWS亦以Trainium2配合Neuron软件,支援PyTorch、vLLM及大型开源模型,尽量降低迁移门槛。

但晶片比较不能只看峰值算力。真正决定成本的是每个Token的综合成本,包括晶片购入或租用价格、记忆体容量、互连效率、电力、散热、集群利用率,以及软件工程投入。某款晶片理论性能再高,若模型只能发挥六成效能,或者调试时间较长,其实际成本未必较低。这亦解释了为何云端巨头有能力自研ASIC,中小型企业却多数继续使用Nvidia:前者每天处理数以万亿计Token,可用庞大固定工作量摊薄设计和软件成本;后者工作量不足,采用成熟平台反而更划算。

「去Nvidia化」首先会在推理市场发生,而不是最前沿模型训练。训练工作负载变化快,需要高度灵活的通用运算能力,Nvidia在软硬件协同、集群规模及故障管理方面仍占优势。推理则相对标准化,模型一旦定型,企业可以透过量化、剪枝及专用晶片降低成本。因此,搜寻、推荐、广告及固定模型服务,最适合转移至TPU、Trainium或自研ASIC;探索性研发及大型模型训练,则仍可能留在Nvidia平台。

中国市场的「去Nvidia化」还多了一层供应链安全考虑。国产AI晶片不仅要追赶运算性能,更要建立编译器、算子库、互连、伺服器和开发者社群。政策和出口管制可以创造替代需求,却不能自动消除软件差距。若企业为满足自主可控而同时维护两套甚至三套技术栈,短期成本反而可能上升。国产替代的成功标准,不应只是晶片能否点亮,而是能否长期稳定运行主流模型,并把迁移及维护成本降至可接受水平。

因此,未来并非「Nvidia被取代」,而是AI算力市场逐渐分层:最前沿训练由Nvidia继续主导,大型云端平台以自研晶片承接固定工作负载,AMD争取需要通用GPU但希望降低供应商依赖的客户,国产晶片则在特定市场及政策环境中扩张。Nvidia的市场份额或会下降,但AI算力总需求仍在增长,其收入未必因此收缩。

所谓「去Nvidia化」,更准确的说法应是「降低Nvidia的边际依赖」。梦想是摆脱单一供应商,现实是软件生态难以绕过,而最终胜负则取决于成本曲线。当替代平台能在不牺牲模型性能和开发速度的前提下,持续降低每个Token的成本,去Nvidia化才会从企业口号变成真正的产业趋势。

义合控股投资者关系部

(芯片与算力系列之82) 


$NVIDIA(NVDA)$  ‌‌$Dell Technologies Inc.(DELL)$  ‌‌$Hewlett Packard Enterprise(HPE)$  

$Yueda Digital Holding(YDKG)$  ‌‌$Arista Networks(ANET)$  

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

举报

评论

  • 推荐
  • 最新
empty
暂无评论