Physical CUDA英伟达如何把护城河从软件延伸到一座 AI Factory
当 AI 的竞争单位从一颗 GPU 升级成一座受 MW 约束的 AI Factory,NVIDIA 的护城河也开始从代码与软件生态,向网络、机架、电力、冷却、LPS 与资本延伸。
Production Function
为什么一家 GPU 公司开始研究土地、变电站和项目融资?
2026 年以来,NVIDIA 的动作越来越不像一家传统半导体公司。5 月底推出 DSX,把 AI Factory 的芯片、系统、软件、设施与伙伴技术放进统一 playbook;8 月又把资本、LPS 与场址开发一起纳入能力边界。
这些动作放在一起,核心问题就从“GPU 性能领先多少”变成:同样给出 1GW 电力约束,哪套架构能更快上线、少浪费更多 MW,并产生更多符合 SLA 的可售 Token?
竞争单位从 GPU 变成 AI Factory
一份 1GW utility power 并不会完整变成 1GW 有效 Compute。电力进入工厂之后,还要经过供配电、冷却、IT load、GPU、Scale-up / Scale-out 网络、Serving、调度与推理引擎,最终才成为 Billable Tokens。
每一个箭头都有浪费点。NVIDIA 的战略边界之所以持续向外扩张,本质上是在尝试把这些浪费点逐层纳入优化。
从 CUDA 到 Physical CUDA:护城河沿着“浪费点”向外扩张
| 层级 | NVIDIA 组件 | 主要解决的问题 | 经济变量 |
|---|---|---|---|
| 软件生态 | CUDA | 开发、工具链与模型迁移成本 | Software switching cost |
| 推理引擎 | TensorRT-LLM | 量化、Kernel、batching、KV Cache 等推理效率 | Tokens/GPU |
| 分布式推理 | Dynamo | Prefill / Decode、KV-aware routing、跨节点调度 | Fleet utilization |
| Scale-up / Scale-out | NVLink / Spectrum-X | GPU 等待和数据搬运损耗 | Useful Compute / Cluster |
| AI Factory | DSX | 芯片、系统、网络、设施、电力和运维协同 | Time-to-Production |
| 固定 MW | DSX MaxLPS | 回收静态供电设计留下的 stranded power | Tokens/MW |
| LPS / 场址 | SB Energy / Cloverleaf 等战略合作 | Time-to-Power 与可交付 MW | Available MW |
| 资本 | Guarantee / Financing Platforms | 项目资本可得性和资金价格 | WACC / MW |
传统 CUDA 的 switching cost 主要发生在代码与开发者生态;Physical CUDA 进一步把路径依赖推向机架尺寸、网络拓扑、液冷、电力分配、设施参考设计以及融资可得性。竞争者不是“不能进入”,而是进入后可能需要重新工程、验证并承担 Time-to-Market 成本。
MaxLPS:从“少浪费 GPU”走向“少浪费 MW”
DSX MaxLPS(Maximum Land Power Shell:在既定土地、电力与建筑壳层约束下,最大化算力与 Token 产出)是理解 Physical CUDA 的关键。它不创造新的物理电力,而是在固定 site power envelope 里,试图让更多电力真正流向有效 Compute。
传统数据中心往往按 MaxP,也就是设备峰值功率进行静态 sizing。真实 workload 并不会让所有 GPU 长时间同时处于峰值,这就形成 stranded power:电力容量已经申请、建设甚至付费,却因为静态安全余量无法转换成更多算力。
NVIDIA 2026 年 8 月 21 日技术说明称,在其 Vera Rubin / GB200 等自有验证口径下,MaxLPS 可在特定设计条件中实现最多约 40% 更多 GPU 容量,并给出约 1.3–1.5× performance-per-watt 改善。这里必须保持边界:这是 NVIDIA 厂商测试结果,取决于设施设计、workload profile 与早期 45°C 液冷规划,不能泛化成所有模型、所有 SLA 下固定提升。
它是在稀缺 MW 无法快速新增时,通过更高的 Compute/MW 制造一部分“虚拟 MW”。电表仍然是原来的 MW,但有效 Token throughput 可以提高。
真正的锁定不是“AMD 放不进去”,而是重做生产资料越来越贵
如果一座 AI Factory 已按 DSX、Rubin NVL72、NVLink、Spectrum-X、特定 rack density、液冷、电气分配与 MaxLPS 设计,未来并非技术上绝对不能换 AMD 或其他 ASIC。真正的问题变成:网络要改多少?液冷是否匹配?power profile 是否重做?Serving stack 是否迁移?设施 redundancy 是否重新验证?融资方是否需要重新 underwriting?
Physical CUDA ≈ Economic Switching Cost + Time-to-Market Cost
这使 CUDA 的路径依赖从 Code Path Dependency 延伸到 Infrastructure Path Dependency。只有当这种路径依赖能够真实降低 Token 成本、缩短上线时间或提高资本效率时,它才构成经济意义上的护城河。
最深的一层,可能是 Financing Compatibility
8 月 10 日,NVIDIA 宣布与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs、KKR 建立独立的 compute financing platforms,目标长期调动超过 5000 亿美元第三方资本,并明确把 NVIDIA compute 与 full-stack AI infrastructure 描述成可投资资产类别。
如果未来出现一条可重复路径——DSX-ready 架构更容易验证,NVIDIA capacity commitment / guarantee 降低项目不确定性,长期资本因此更愿意提供债务或权益资本——那么架构选择就可能进一步影响:
现阶段“普遍 WACC 优势”仍然是需要验证的推论,而不是已经证明的行业事实;但 NVIDIA 已经把资本市场明确纳入 AI Factory 战略边界。
AMD 与 Google:Physical CUDA 并不是没有对手
| 维度 | NVIDIA | AMD | |
|---|---|---|---|
| 基本路线 | 把全栈 reference architecture 输出给产业 | 用开放标准重建 rack-scale 替代栈 | 在自有模型、云与数据中心内纵向协同 |
| Compute | Vera Rubin / NVL72 | MI455X / Helios 72-GPU | TPU 8t / TPU 8i |
| Scale-up | NVLink | UALink / UALoE | ICI |
| Scale-out | Spectrum-X / InfiniBand | Ultra Ethernet / Pensando | Virgo Network |
| Software | CUDA / TensorRT-LLM / Dynamo / DSX | ROCm + open frameworks | JAX / XLA / Pathways + AI Hypercomputer |
| Facility / Power | DSX / MaxLPS,以 Token/MW 为公开目标 | Helios 把 rack power、liquid cooling、serviceability 纳入 open reference design | TPU 与数据中心、电力管理、液冷长期协同设计 |
AMD:用开放标准攻击“物理锁定”
AMD Helios 把 72 颗 MI455X、EPYC、Pensando networking 与 ROCm 组成统一 rack-scale 方案,并明确采用 OCP Open Rack Wide、UALink 与 Ultra Ethernet。AMD 的战略反击不是否定系统级整合,而是主张:系统级整合也可以建立在开放标准之上,从而降低 vendor lock-in。
Google:更像“内部版 Physical CUDA”
Google 同时控制 TPU、ICI、Virgo、JAX / Pathways、Axion host、液冷、电力管理和数据中心。2026 年 Google 披露,TPU 8t / 8i 相较 Ironwood 可实现最高约 2× performance-per-watt,并称其数据中心五年内每单位电力可提供约 6× 的计算能力。
NVIDIA 更像:Define the Factory。Google 先把纵向整合服务于 Gemini 与 Google Cloud;NVIDIA 的野心是把类似协同设计能力输出成整个产业可复制的 AI Factory 标准。
Physical CUDA 要成为真正的新护城河,还必须通过四个检验
最终评价链:从 MW 到 Token,再到 Revenue 与 ROIC
Physical CUDA 的价值不能用“NVIDIA 控制了多少层”来衡量。每多控制一层,只有在减少浪费、缩短上线时间或降低资本成本时才有意义。
NVIDIA Advantage ≈ Δ Tokens/MW + Δ Utilization + Δ Uptime + Δ Time-to-Production + Δ Financing Cost。最终只有当这些增益足以覆盖更高的系统资本成本,才会兑现为 Lower Cost/Token、Higher Revenue/MW 与 Higher ROIC。
NVIDIA 正在从 Token/MW 往前倒推,把每一个可能卡住 AI Factory 的变量纳入能力边界
过去理解 NVIDIA,投资人习惯从 CUDA 往下看:开发者越多、软件生态越强,GPU 越难替代。现在更值得做的,是从最终经济产出往前倒推。
NVIDIA 不需要拥有每一个环节。更高资本效率的策略可能是:不持有所有资产,却通过技术标准、reference architecture、战略股权、信用支持和生态伙伴影响这些资产未来如何被设计、融资和使用。
Physical CUDA 试图进一步影响“未来的 MW 按什么架构被建出来、如何被融资,并最终生产多少 Token”。
主要资料
EnyaClawd
把 NVIDIA 的软件生态、系统架构、电力效率、LPS 与资本工具放进同一条生产函数。Physical CUDA 是投资研究框架,不替代真实 benchmark;最终仍以 Tokens/MW @ SLA、Tokens/$TCO、Revenue/MW 与 ROIC 验证。