互连与网络

两张网络决定昂贵芯片是否在等待,以及内容增长最终由谁获取。

第 2.6 章|互连与网络

购买更多 GPU 不一定得到更多有效算力。集群越大,芯片等待通信、同步参数和恢复故障的时间越可能吞掉理论性能。网络不是服务器旁边的配套设备,而是计算资产利用率的一部分。

一颗 GPU 可以很快,十万颗 GPU 却不一定像十万颗一样工作。训练一个大模型时,不同芯片只处理任务的一部分,必须频繁交换参数和结果。只要一条链路拥塞、一个节点故障或同步稍慢,其他昂贵芯片就可能停下来等待。

这种等待对用户看不见,却直接烧钱。一颗 GPU 每小时都在折旧并消耗电力;如果 20% 的时间用于等待网络,客户实际上用完整成本购买了 80% 的有效计算。芯片越昂贵、集群越大,网络失效的机会成本越高。

网络为什么决定集群能否有效工作

分布式训练会把模型切分到大量芯片上,每一步都要交换梯度并保持同步;推理时,超大模型也可能跨多个加速器和内存池。只要通信延迟、拥塞或故障让部分芯片等待,昂贵的计算资源就无法保持有效利用。网络因此必须同时提供带宽、低延迟、拥塞控制、可靠传输和故障恢复。

因此,峰值带宽只是上限。真正决定经济价值的是:

如果投资者只比较“800G 还是 1.6T”,就像只比较高速公路限速,却不看堵车、收费站和事故恢复。

两张网络承担两种任务

AI 系统的通信大致分成两个层次。

Scale-up 在单台服务器、单个机架或紧密系统内部连接几十颗加速器。这里要求极低延迟、极高带宽和内存语义的一致性。Nvidia 的 NVLink/NVSwitch 是当前主导方案,竞争者则推动 UALink、Scale-Up Ethernet 等开放路线。

Scale-out 把成千上万个服务器和机架连接成数据中心级集群。这里的竞争发生在 InfiniBand、Nvidia Spectrum-X 和开放以太网之间,还需要交换机、网卡、光模块、铜缆、光纤与网络操作系统。

两层网络的工程要求和利润池不同:

比较Scale-upScale-out
连接范围芯片、托盘、机架内部服务器、机架和数据厅之间
核心要求极低延迟、极高带宽、紧密一致可扩展、拥塞控制、路由与故障恢复
主要路线NVLink/NVSwitch、UALink、SUEInfiniBand、Spectrum-X、以太网
控制价值与加速器架构深度绑定标准、交换芯片、网络软件与客户关系
开放难度很高,必须与芯片和内存共同设计相对较低,但十万卡稳定性仍难

前沿训练频繁同步,通常愿意为专有整合支付溢价;推理更重视吞吐、延迟和成本,也更容易采用标准以太网。随着集群扩大,两张网络都增加内容,不能把“以太网份额上升”简单理解为所有专有互连都会消失。

市场增长很快,利润不会平均分配

AI 数据中心网络市场

行业预计,到 2028 年数据中心 AI 网络厂商收入将超过 250 亿美元。这个数字描述的是设备与芯片收入机会,不是每家供应商都能获得的利润池。1

企业证券控制点
NvidiaNVDANVLink、InfiniBand、Spectrum-X 与端到端系统
BroadcomAVGOTomahawk、Scale-Up Ethernet、定制芯片和 CPO
AristaANET大规模以太网交换机与网络软件
MarvellMRVL定制互连、DSP 与光电芯片
Astera LabsALABRetimer 与连接芯片
CredoCRDO有源电缆与高速 SerDes
Coherent、LumentumCOHR、LITE激光器与光学元件
FabrinetFN光模块制造

靠近系统架构的供应商,更容易控制标准、软件和客户关系;靠近零部件的公司,可能获得更高单位内容增长,也更容易面对降价、多个来源和大客户议价。

交换芯片和网络操作系统决定拓扑与拥塞管理,通常拥有较高架构价值。光模块、DSP、激光器、连接器和线缆数量随带宽快速增长,却可能被标准化。某个部件出货翻倍,如果平均售价下降更快、客户要求第二来源,利润未必增加。

专有整合卖的是确定性,开放标准卖的是选择权

Nvidia 把 GPU、NVLink、交换机、网卡和软件共同设计。客户购买整套系统,部署路径更清晰、性能更容易复现,也被更深地锁进 Nvidia 架构。这种模式的价值是确定性:前沿实验室不希望花数月调试网络,只想让训练任务尽快运行。

开放阵营提供另一种价值——选择权。Ultra Ethernet、UALink 与 Scale-Up Ethernet 允许客户组合不同加速器、交换机和光模块,降低单一供应商依赖,并利用成熟以太网生态控制成本。

但标准文件不是生产系统。开放方案必须同时证明:

联盟成员越多,只能说明产业希望有替代方案。真正的拐点,是主要云厂商把前沿训练部署到开放网络上,并连续披露接近专有系统的利用率和稳定性。

如果开放方案成熟,价值可能从 Nvidia 的封闭系统流向 Broadcom、Arista、Marvell 和独立光学供应链;如果规模越大越难管理,客户反而会为端到端整合支付更高溢价。

为什么网络内容会比 GPU 数量增长更快

小集群可以用较简单拓扑连接,超大集群却需要更多交换层级、冗余链路和故障隔离。每增加一批 GPU,网络设备不一定只按相同比例增长,特别是当带宽从 400G 升到 800G、1.6T,并且需要跨机架、跨数据厅连接时。

内容增长来自四个方向:

  1. 每颗加速器需要更高速网卡和 SerDes;
  2. 集群规模扩大增加交换机层级和端口;
  3. 电连接距离受限,更多链路从铜转向光;
  4. 为提高可靠性,需要冗余、监控与故障隔离。

这解释了为什么网络收入可能快于 GPU 颗数。但它也提高供应链复杂度:同一训练任务中,交换芯片、模块、激光、光纤、连接器和软件必须共同工作。某个零件即使很便宜,也可能成为整套系统交付瓶颈。

光学靠近芯片后,价值链会被重新切分

电信号在更高速、更长距离下损耗和功耗迅速上升,因此 AI 数据中心从铜缆逐步转向光纤。可插拔光模块把电信号转换为光信号,安装和替换方便,却要在交换机面板上占据空间并消耗电力。

共封装光学(CPO)把光学引擎移到交换芯片附近,缩短高速电连接,提高带宽密度并降低部分功耗。长期来看,光学还可能进一步靠近加速器和封装。

技术更先进不代表现有光模块公司自动受益。CPO 可能增加激光器、硅光、先进封装和测试价值,也可能把原本独立可替换的模块功能整合进 Broadcom 或 Nvidia 的系统。客户从购买一个标准模块,变成购买一套集成交换平台,利润控制点就会迁移。

投资者要问的不是“光会不会更多”,而是:

如果片上或封装内激光可靠性不够,行业可能更长时间停留在可插拔模块,远期收入就会延后。

Broadcom 为什么拥有较分散的架构敞口

Nvidia 的优势来自端到端专有系统,Broadcom 的优势则来自参与多条路线。若超大云继续自研 ASIC,Broadcom 可以提供定制设计与高速互连;若开放以太网扩大,Tomahawk 交换芯片和 Scale-Up Ethernet 受益;若 CPO 渗透,它又参与交换硅和光学集成。

这使 Broadcom 接近“多种架构都能收费”,但不是无风险。业务高度依赖少数超大客户和大项目,每个项目跨越数年;客户可能自行设计、延迟部署或把下一代订单转给竞争者。估值还可能提前反映所有路线成功。

Arista 更集中于 scale-out 以太网与网络软件;Astera Labs 和 Credo 押注连接内容;Coherent、Lumentum 与 Fabrinet 押注光学。它们共享 AI 集群需求,却没有相同客户集中、毛利和技术替代风险。

真正的分散不是产品名称更多,而是收入来自不同客户、不同标准和不同故障条件。

中国越受单颗芯片限制,越需要高效网络

中国大型集群要连接更多性能较低的加速器,网络效率因此更加重要。华为通过 CloudMatrix、灵衢和 Atlas SuperPoD 等系统,把大量昇腾节点组合成一台超大机器,试图用系统规模和自有网络弥补单颗芯片差距。

这条路线既合理,也昂贵。更多节点意味着更多交换机、线缆、电力、冷却和故障点。假设每个节点可靠性相同,节点数增加会提高系统中任一节点发生问题的概率;软件必须更快检测、隔离并恢复,才能避免大量芯片等待。

中国拥有较完整的通信设备和光模块供应链,高端 SerDes、先进交换芯片和超大规模集群软件仍是难点。芯片限制越严,网络 BOM 内容越高;但内容更高不一定等于经济效率更高。

因此,评估中国 SuperPoD 不能把“卡数更大”直接当成“算力更强”。至少要比较:

网络投资最终要用 GPU 等待时间验证

网络公司的订单和收入容易观察,客户集群的实际利用率却很少公开。投资者可以使用一组替代信号:

观察项它验证什么
网络占机架 BOM 的比例内容是否随系统密度提高
800G、1.6T 与 CPO 量产时间技术路线是否转成收入
以太网用于前沿训练的案例开放方案是否越过生产门槛
交换芯片与光模块毛利内容增长是否留下利润
大客户占比与下一代设计中标收入是否可持续
集群利用率和故障恢复网络是否真正提高有效算力

Nvidia 网络护城河会在开放方案以更低总成本稳定运行超大训练集群时松动。反之,如果规模扩大让拥塞和故障更难处理,端到端整合的价值会继续提高。

共封装光学的多头逻辑会在可靠性、量产和客户部署同时出现时成立;如果行业继续依赖可插拔模块,相关收入只是延后,不一定消失,但高估值可能先调整。

这一层最应记住的不是带宽数字,而是一条简单判断:

客户购买的是完成模型所需的时间,不是芯片峰值之和。谁能减少 GPU 等待,谁就在创造可收费的计算。

平台级网络和光学内容如何进入中美四套完整系统,见第 2.13 章。


图表与关键证据来源

Footnotes

  1. Data Center AI Networking to Surge to Over $25B in 2028. 650 Group,2024 年 1 月 24 日;访问于 2026 年 7 月 25 日。