云与软件护城河

比较超大云、新云、CUDA 和中国平行云栈的利用率、黏性与融资风险。

第 2.4 章|云与软件护城河

云不是简单的 GPU 转租业务。它同时控制算力采购、开发工具、企业合同和资本回收;真正的差别在于利用率、软件黏性与融资结构。

两类云,一种核心问题

超大云厂商拥有完整平台、客户关系和资产负债表;新云厂商以更纯粹的 GPU 供给、更快部署和大型长期合同切入。两类公司面对同一个问题:昂贵硬件能否在快速迭代前保持足够高的利用率和租金。

平台类型核心位置主要风险
AWS(AMZN)超大云全球份额第一,自研 Trainium资本回报、AI 份额
Microsoft Azure(MSFT)超大云OpenAI、企业软件与开发者分发客户集中、资本开支
Google Cloud(GOOGL)超大云Gemini、TPU、搜索与数据变现速度
Oracle(ORCL)超大云大型 AI 集群与 Stargate债务和项目集中
CoreWeave(CRWV)新云纯 GPU 云、大额积压订单融资、客户集中、折旧
Nebius(NBIS)新云欧洲和美国 AI 基础设施扩张执行
Crusoe、Lambda新云定制园区与 GPU 云私募估值、资本需求
阿里云(BABA)中国云国内规模第一、Qwen 生态价格竞争
华为云中国云昇腾、CANN 与 CloudMatrix先进芯片供给
腾讯云(0700.HK)中国云社交、游戏和企业客户GPU 供给与披露

超大云厂商:AI 增长藏在综合报表里

全球云基础设施份额

AWS、Azure 和 Google Cloud 同时受益于 AI 训练、推理、数据服务和企业迁移,但披露口径不同。所谓“AI 收入运行率”可能包括模型 API、GPU 实例、Copilot、数据服务甚至传统云迁移,不能直接横向比较。

它们真正的优势是内部组合:自研芯片降低成本,公共云吸收不同客户需求,软件和数据服务提高毛利,全球网络调度利用率。即使某一代 GPU 过时,也可以通过降价、批处理和内部工作负载继续使用。

新云厂商:积压订单大于收入

新云厂商收入与积压订单

CoreWeave 等公司的积压订单远高于当期收入,说明客户愿意提前锁定算力,也说明未来现金流依赖少数大合同按时履行。GPU 抵押融资和长期数据中心租约放大了增长,也缩短了容错空间。

分析新云不能只看签约额,应同时看:

高积压订单是需求信号,不是已经实现的利润。

CUDA:比芯片更持久的护城河

Nvidia 的优势不只在 GPU,而在 CUDA、库、编译器、调试工具和开发者经验。迁移到另一种加速器,意味着重写内核、验证精度、重新训练工程团队,并承担生产中断风险。这种软件切换成本比单代芯片性能更持久。

护城河并非没有裂缝。PyTorch、Triton、开放编译器和云厂商自研芯片逐步把上层软件与底层硬件分离。对于规则明确、规模稳定的推理任务,TPU、Trainium 和定制 ASIC 可以用更低总成本替代 GPU。前沿训练仍偏好完整的软件与网络一体化,成熟推理则更愿意为价格迁移。

中国的平行云栈

中国云市场由阿里、华为、腾讯和运营商主导。出口限制减少了先进 Nvidia 芯片供给,迫使平台同时适配昇腾、海光、寒武纪等本土加速器。CANN 与 CUDA 的差距不仅是软件功能,还包括开发者数量、算子优化、故障处理和跨集群调度。

中国云的优势是本土客户、政策需求和数据合规;弱点是硬件代际、软件碎片化和价格竞争。投资者要区分“国产算力采购增加”与“云业务利润改善”:前者可以很快发生,后者取决于利用率和客户付费。

推理专业平台会不会独立成层

Groq、Cerebras、SambaNova 等用自研硬件提供低延迟推理。它们能在特定模型和批量下展示显著性能,但要成为持久平台,还需证明模型覆盖、软件兼容、全球部署和单位经济性。若模型路由成为常态,这些专业平台可能作为后台执行层存在;若超大云通过自研芯片复制其成本优势,独立利润空间会被压缩。

投资判断:云的核心是现金转化

超大云厂商的优势是分散客户、软件毛利与融资能力,但 AI 资本开支对自由现金流的压力越来越明显。新云的优势是增长纯度和部署速度,但更容易受单一客户、信贷和硬件折旧影响。

判断云层是否健康,重点看收入与资本开支是否同步转化,而不是只看需求表述。若 AI 收入、利用率与自由现金流连续改善,平台模式得到验证;若积压订单延迟、租金下降而债务继续上升,云层会成为整条 AI 资本链最早暴露信用风险的地方。