KERWIN RESEARCH HUBREADER ACCESS
Kerwin
Research
AI CLOUD ECONOMICS · 2026.08
AI Cloud(AI云)四层经济模型

输入 “k” 即可显示从 1MW 到 Token,再到利润池:把算力资产、存储 BOM、智能产出和价值捕获放回一条连续的经济链。

K / ENTER
Snapshot:2026-08-18。事实、基准、价格代理与情景假设分层表达;仅用于研究与情景匡算。
Kerwin × Enya · AI InfrastructureBenchmark v0.5.1 · Editorial Rebuild · 2026-08-18
KerwinRESEARCH HUB返回首页 →
AI CLOUD ECONOMICS · FOUR-LAYER MODEL

AI Cloud(AI云)四层经济模型从 1MW / 1GW 到 GB300 与 Vera Rubin,再到谁拿走下一代算力的利润池

真正要回答的不是“1GW听起来有多大”,而是:1GW 电力最终能转成多少可售算力、需要多少资本、对应多少 Memory BOM(内存与存储物料)、能生产多少 Token(模型处理单位),以及这些效率红利最终由 AI Cloud(AI云)还是模型公司捕获。

核心原子单位:1MW IT Load(IT负载)现实锚:IREN × Microsoft / GB300前瞻锚:Vera Rubin / Token-MW / Value Capture
1MWPOWER → GPU
MEMORY → TOKEN
VALUE CAPTURE
阅读方法:这不是四个并列模块,而是一条因果链:电力 → IT Load → GPU → Memory BOM → Token/MW → 定价制度 → Revenue / ROIC(投入资本回报率)。GPUh Revenue(GPU小时收入)、Token Fee Revenue(按Token收费收入)与 Revenue Share(收入分成)是同一批算力的替代定价制度,不能相加。

先把研究问题说清楚:AI Cloud 到底是一门“租机器”的生意,还是一门“卖智能产出”的生意?

过去研究 AI 基础设施,最容易被“多少GW、多少张GPU、多少亿美元Capex”牵着走。但这些数字只有放进同一条经济链里才有意义。电力不是收入,GPU数量也不是利润;真正决定股东回报的是电力如何转成可计费算力、可计费算力如何转成 Token,以及定价权最终停留在哪一层。

当前阶段,GB300(Blackwell Ultra,Blackwell Ultra代际GPU)给我们现实世界的合同和部署锚;Vera Rubin(下一代Vera CPU + Rubin GPU平台)则迫使估值框架进一步升级:如果同样 1MW 电力能生产数倍 Token,而云服务商仍只按 GPUh(每GPU小时)收费,那么大部分代际效率红利会进入模型公司的毛利率,而不是云服务商的收入/MW。

第一层:先统一 1MW ITGross Power(总电力)必须经过 PUE(电力使用效率)换成真正可用的 IT Load(IT负载)。
第二层:穿透资本去向每1GW不只有GPU,还对应HBM、CPU内存与NAND;Memory BOM是完整Capex的组成部分。
第三层:从GPUh走向TokenRubin最重要的不是多塞多少GPU,而是同一MW能生产多少Token。
第四层:决定估值的是价值捕获同一轮性能提升,可能成为云服务商收入,也可能成为模型公司的成本下降。

因此,这套模型的目标不是给一个“行业标准答案”,而是建立一把可以反复校准的尺子:每出现一个真实合同、一个新GPU代际、一组Token价格或一种新收费方式,就知道应该改哪一项假设,以及结论为什么会变。

这套模型为什么从 IREN 开始:真实合同第一次把“MW”与“收入”钉在一起

在没有合同锚之前,“1GW AI算力值多少钱”很容易变成拍脑袋。IREN 与 Microsoft 的合同给了一个很干净的现实样本:$9.7B、5年、200MW Critical IT Load(关键IT负载)。

200MW Critical IT Load不是园区Gross MW,而是可以承载客户计算负载的关键IT容量。
$1.94B 年化合同收入$9.7B ÷ 5年,得到满负荷年化收入。
≈$9.7M ARR / MW IT这是当前大型长期AI Cloud合同的现实下锚之一。

这一步先解决了一个基本问题:以后看到任何“几百MW、几GW”的AI项目,都不能直接拿Gross Power(总电力容量)乘收入。必须先问清它到底是 Secured Power(已锁定电力)、Energized Power(已通电容量)、Facility Power(设施容量)还是 Critical IT Load(关键IT负载)。

口径它回答什么问题能不能直接用于收入估值
Secured Power(已锁定电力)未来最多可能拿到多少电不能,只是远期天花板
Energized Power(已通电容量)多少容量已经具备部署条件仍不能,尚未等于IT负载
Gross / Facility Power(总/设施电力)数据中心总耗电能力要通过PUE换算
IT Load / Critical IT Load(IT/关键IT负载)服务器、GPU、网络真正可使用多少电最适合跨项目比较

PUE 把 1GW 电力变成多少 IT Load?

PUE(Power Usage Effectiveness,电力使用效率)= 数据中心总耗电 ÷ IT设备耗电。工作参考带约 1.10–1.25,因此 1GW Gross Power 大约对应 0.80–0.91GW IT Load。换句话说,1MW IT Load 才是这套经济模型真正的“原子单位”。

为什么先做这一步:只有把MW口径统一,后面的GPU数量、ARR/MW、Capex/MW、Memory BOM/MW和Token/MW才有可比性。否则一个公司报Gross MW,另一个公司报Critical IT MW,横向比较从第一步就已经错了。

第一层:1MW IT Load 如何变成 GPU、GPUh收入、Capex 与回本期

有了统一的 1MW IT 口径,才可以进入真正的云经济账。GB300 用于校准当前合同和部署;Rubin 用完全相同的尺子做前瞻情景。两个面板不是两篇研究,而是同一套公式在两个硬件代际上的复用。

GB300(Blackwell Ultra)当前主力部署 / 合同现实锚
Gross Power(总电力)数据中心总功率
MW
PUE(电力使用效率)Gross ÷ IT
x
GPU IT 功率机架级等效
kW
GPU Utilization(利用率)全年可计费时长
%
GPUh(每GPU小时)大型客户长约工作值
$/h
GPU全栈 Capex(资本支出)GPU+服务器+网络+安装
$k
非GPU基建 Capex每MW IT
$m
Project EBITDA Margin项目口径,不等于公司整体利润率
%
HBM3E Price Proxy288GB/GPU
$/GB
CPU Memory Price Proxy236GB/GPU
$/GB
NAND Raw Value8.5TB/GPU本地盘
$/TB
Token Throughput(Token吞吐)特定推理基准锚
M/s/MW
IT LoadGross ÷ PUE
GPU Count按IT功率密度
GPUh ARR云服务商传统收入
Capex / MW IT完整资本强度
Project PaybackEBITDA口径
Memory BOM / MW已包含于全栈Capex
Memory / Capex存储物料占完整资本支出
Vera Rubin下一代平台 / 前瞻工作情景
Gross Power(总电力)默认与GB300同规模
MW
PUE液冷工作值
x
GPU IT 功率整架可比功耗待实机校准
kW
GPU Utilization全年可计费时长
%
GPUh(前瞻)非已签合同价格
$/h
GPU全栈 Capex前瞻工作值
$k
非GPU基建 Capex每MW IT
$m
Project EBITDA Margin情景假设
%
HBM4 Price Proxy288GB/GPU;22TB/s带宽
$/GB
Vera CPU Memory Proxy750GB/GPU等效
$/GB
NAND Raw Value8.5TB/GPU floor(下限)
$/TB
Token / MW Multiplier相对GB300 Base Case
x
IT LoadGross ÷ PUE
GPU Count功率密度工作值
GPUh ARR前瞻情景
Capex / MW IT完整资本强度
Project PaybackEBITDA口径
Memory BOM / MWHBM4+Vera内存+NAND
Memory / Capex存储物料占完整资本支出

这张面板先回答“资产经济账”:同样的 IT Load,能部署多少GPU、以什么GPUh价格出租、需要多少资本、多久回本。它暂时还没有回答 Rubin 为什么值得单独建模——这个答案要继续往硬件组成和单位电力产出穿透。

先记住一个口径:Memory BOM(内存与存储物料)不是在 Total Capex(总资本支出)之外额外加的一笔钱。它是全栈GPU/服务器资本支出的穿透组成部分,因此 $3.7B 不能再加到约 $43B 上。

第二层:当 1MW 已经换成 GPU,下一步就能算每1GW到底有多少资本流向内存与存储

这一层的意义,是把云服务商的Capex继续穿透到上游产业链。物理含量来自系统规格,价格环境再用内存厂商财报和市场价格代理校准。这样才能回答:AI Cloud扩1GW,对 HBM(高带宽内存)、CPU侧内存和 NAND(闪存)的经济含量大约是多少。

1GW IT 工作中枢GB300(Blackwell Ultra)Vera Rubin为什么重要
GPU数量≈500K≈500K*当前先保持可比密度;Rubin真正的核心不是简单“多塞GPU”。
HBM容量≈144PB HBM3E(第三代增强型高带宽内存)≈144PB HBM4(第四代高带宽内存)容量相近,但带宽、工艺复杂度和价格代理不同。
CPU侧内存≈118PB≈375PB LPDDR5X(低功耗内存)Vera CPU带来的CPU内存池明显扩大。
本地NAND≈4.25EB≈4.25EB floor(下限)*Rubin共享KV Cache(键值缓存)/STX层尚未完全计入。
Memory BOM≈$3.7B≈$7.2B上游经济含量代理;属于完整Capex组成部分。
Memory BOM / Total Capex≈8%–9%≈13%–14%把“新增1GW AI算力”映射成Memory+Storage价值池。

因此,GB300 的约 $3.7B/GW 不是“存储成本再加37亿美元”,而是告诉我们:在约 $43B/GW 的完整 AI Factory(人工智能工厂)资本支出里,大约一成的经济价值可以穿透到 HBM、CPU内存和本地NAND这一组Memory/Storage(内存/存储)部件。Rubin由于 HBM4、Vera CPU内存和更复杂的存储体系,这个比例在当前工作模型里上升到约13%–14%。

但更高的 Memory BOM 仍然不是 Rubin 最重要的经济变化。真正决定下一代算力价值的,是同样1MW电力究竟能生产多少Token。这就把研究从“资本投入”推进到“智能产出”。

从 GB300 到 Rubin:真正跃迁的是生产函数,而不是“1GW里多装了多少张GPU”

GB300 与 Rubin 都可以先按约450–500张GPU/MW IT做数量级比较,但两代平台的内存带宽、CPU内存池和推理吞吐已经不是同一个生产函数。

关键变量GB300Vera Rubin当前模型怎么处理
HBM / GPU288GB HBM3E288GB HBM4容量不翻倍;Rubin主要升级带宽与价值含量。
HBM带宽约8TB/s/GPU级别22TB/s/GPURubin内存供给能力显著提高。
CPU侧内存 / GPU等效约236GB约750GBVera CPU把CPU内存池提高到约3倍量级。
Token Throughput / MW2.8M tokens/s/MW特定基准Base Case(基础情景)≈3× GB3003×是Kerwin/Enya工作假设,不是NVIDIA官方统一承诺。
GPUh价格默认$4/h默认$4.5/h前瞻情景收入涨幅远小于Token/MW潜在涨幅。

NVIDIA在特定 DeepSeek-R1、Kimi-K2-Thinking 等场景给出的 Rubin 性能上锚更高,但比较对象、模型与延迟条件并不等同于 GB300 的通用生产环境。因此这套模型不把“10×”直接当成行业事实,而是保守地先用 2.5–5×工作带、3× Base Case,等待真实生产部署验证。

这一节产生了全文最关键的新问题:如果 Rubin 的 Token/MW 真的约为 GB300 的3倍,而云服务商的GPUh价格只从$4提高到$4.5,那么“多出来的Token”并不会自动变成云服务商收入。它首先会变成模型公司的单位Token成本下降。于是下一步必须把Token产能和定价制度放进同一张账。

第三层:从“机器时间”走到“智能产出”——Token产能如何变成收入

当前典型商业关系是:AI Cloud / Neocloud(新型GPU云)按 GPUh 向模型公司出租算力;模型公司再按 Token、API(应用程序接口)或订阅向终端客户收费。因此,云服务商的GPUh收入,正是独立模型公司的Compute Cost(算力成本)

AI Cloud / Neocloud投入GPU、电力、数据中心、网络与存储;当前主要卖GPUh。
模型 / API 公司购买算力,把GPUh转换成Token,再承担模型、软件与产品层成本。
终端客户按API、Token、订阅或Agent结果付费,形成最终AI收入池。

因此不能把“GPUh ARR”和“Token Revenue”当成两笔可以相加的收入。它们分别代表同一批算力在不同收费制度下的价值捕获方式。为了把这件事说清楚,模型把两个概念彻底拆开:

终端 API Price模型公司售价用户为模型能力付多少钱;包含模型、软件、品牌、产品与渠道价值。
Infra Token Fee云端Token费云服务商若按Token收费,这是独立的$/百万Token基础设施合同价。
Revenue Share收入分成云服务商直接按模型/API终端收入的一定比例分享价值池。
Token Monetization Inputs终端API收入与云端Token收费分开建模。
Sellable Token Utilization理论吞吐中真正形成付费需求的比例
%
Input / Output Ratio每1输出Token对应输入Token
x
API Input Price终端客户输入Token价
$/1M
API Output Price终端客户输出Token价
$/1M
Price Realization批处理/缓存/大客户折扣后的实现率
%
Infra Token Fee独立云端收费;默认贴近GB300 GPUh平价
$/1M
Token EconomicsModel/API GMV属于模型公司收入池;Cloud Token Revenue属于云服务商。
Realized API Price终端综合实现价
Infra Token Fee云端独立Token收费
GB300 Model/API GMV / GW终端收入池情景
Rubin Model/API GMV / GW同一价格篮子情景
GB300 Cloud Token Rev / GW按Token收费
Rubin Cloud Token Rev / GW按Token收费
GB300 GPUh Parity Fee与现有GPUh收入持平
Rubin GPUh Parity FeeToken/MW越高,平价费越低
如何读四个常见数字:GB300约$14.9B/GW GPUh ARR与约$14.8B/GW Token Fee Revenue是两种替代收费方式;Rubin约$16.8B/GW GPUh ARR与约$44.5B/GW Token Fee Revenue同理。它们之间的差额不是“多出来的一笔收入”,而是在衡量下一代GPU的效率红利到底可能被谁拿走。

第四层:谁拥有额外 Token 的经济权,才真正决定两类公司的估值

当 Token/MW 增长远快于 GPUh 价格时,价值捕获就会从“硬件性能问题”变成“合同定价问题”。同一轮 Rubin 性能升级,在不同收费制度下,可以让云服务商更像重资产租赁公司,也可以让它逐步向平台型基础设施迁移。

Revenue Share Input(收入分成)第三种定价:云服务商直接分享模型/API终端收入。
Cloud Revenue Share终端模型/API收入支付给云端的比例
%
① GPUh资产租赁云收入主要由GPU数量×小时×租金决定;Token/GPUh提升先进入模型公司毛利。
② Token-based产量定价云收入随Token产量增长;基础设施开始直接分享Rubin的生产率提升。
③ Revenue Share价值定价云服务商按终端AI收入分成,与模型公司成为经济利益共同体。

两个新指标,把利润池迁移量化

GPUh · PERFORMANCE UPSIDE CAPTURERubin性能提升有多少转成云收入增幅
GPUh · COMPUTE EFFICIENCY RETENTION模型公司保留多少理论算力效率红利
TOKEN FEE · PERFORMANCE CAPTURE固定Token费下云收入随产量增长
REVENUE SHARE · PERFORMANCE CAPTURE固定分成率下云端参与终端价值增长

Performance Upside Capture(性能提升价值捕获率)回答:Token/MW提高100%,云服务商收入提高多少;Compute Efficiency Retention(算力效率留存率)回答:硬件带来的理论单位Token成本下降,有多少最终真正留在模型公司。

默认情景下,Rubin Token/MW = 3× GB300,而GPUh只从$4提高到$4.5。此时云端的 Performance Upside Capture 只有约6%,模型公司保留约94%的理论算力效率红利。这个结果不是行业事实,而是一个非常有用的“基准假设”:它告诉我们未来为什么要重点跟踪云合同有没有从GPUh迁移到Token-based或Revenue Share。

1GW IT:三种收费制度下,利润池如何重分配

收费制度GB300 云收入Rubin 云收入GB300 Model/API GMVRubin Model/API GMVRubin扣云算力后的收入
GPUh(每GPU小时)
Token-based(按Token收费)
Revenue Share(收入分成)
价值捕获的本质:GPUh、Token Fee 和 Revenue Share 不是三条收入线,而是三种定价权安排。下一代GPU的投资价值,不只取决于“快多少”,更取决于“谁有权把变快后的产出重新定价”。

估值含义:AI Cloud 与模型公司的价值池是一架跷跷板

到这里,前面所有工程参数才真正落到估值。对独立云服务商而言,模型公司的Compute Cost就是自己的Revenue;对模型公司而言,云端定价制度决定了硬件效率提升能否完整转成Gross Margin(毛利率)扩张。

公司类型GPUh主导时怎么看Token / Revenue Share上升后怎么变新增核心指标
AI Cloud / Neocloud更像重资产基础设施:EV/MW、EV/ARR、Project EBITDA、Capex/MW、Payback、ROIC/WACC。收入开始跟随“智能产出”而不只是资产小时数;如果能持续捕获性能红利,收入/MW和ROIC上限提高,估值可能向平台型基础设施迁移。Token Revenue/MW、Performance Upside Capture、Revenue Share、Token Revenue/Capex。
模型 / API 公司固定或相对固定的GPUh成本,让Token/GPUh提升形成强Operating Leverage(经营杠杆)。如果云端按Token/收入抽取更多价值,硬件效率红利不再全部进入模型公司毛利,长期Gross Margin与FCF Margin要重新评估。Compute Efficiency Retention、Compute Cost/Token、Compute Cost/API Revenue、长期毛利率。
垂直整合 Hyperscaler(超大规模云厂商)云与模型同集团时,内部GPUh收入/成本在合并报表中抵销。重点转向集团整体每1美元AI Capex创造多少Revenue、EBIT、FCF和ROIC。Consolidated AI ROIC、Capex效率、外部客户收入占比。

因此,对 IREN、CoreWeave、Nebius 一类独立AI Cloud,未来最值得观察的不是“Rubin租金比GB300贵多少”,而是合同有没有出现 Performance Upside Capture 的提升;对 OpenAI、Anthropic、xAI 等模型公司,则要反过来看 Compute Efficiency Retention 是否被云端重新定价侵蚀。

一句话落地:如果AI Cloud永远只卖GPUh,它更像“GPU房东”;如果它能稳定按Token或收入分成,它开始分享模型层的增长;反过来,模型公司越能锁定长期低价GPUh,越能独享下一代GPU带来的单位Token成本下降。

截至 2026-08-18 的工作参考带,以及一个月后应该验证什么

这套框架的价值在于可证伪。下面不是“行业定律”,而是当前快照;新合同、新硬件与新价格出现后,应该逐项上调、下调或推翻。

指标当前工作带 / 中枢一个月后最重要的验证点
PUE(电力使用效率)1.10–1.25 / 1.15新建液冷AI园区能否稳定接近1.1。
GPU / MW IT≈450–500Rubin整架真实功耗公布后重新计算。
大型客户GPUh$3–5 / $4GB300真实长约与Rubin首批合同价格。
ARR / MW IT$10M–16MIREN等新增合同的MW口径是否继续落在区间。
完整AI Factory Capex / MW$30M–55MRubin全栈采购价、网络和液冷资本强度。
GB300 Token Throughput2.8M/s/MW特定基准更多模型/延迟条件下的生产环境数据。
Rubin Token/MW2.5–5× / 3× Base若真实数据长期低于2×,必须下修整个Rubin经济模型。
Memory BOM / GWGB300≈$3.7B;Rubin≈$7.2BHBM4、LPDDR5X与企业级SSD实际价格和容量配置。
Infra Token Fee默认$0.24/1M情景是否出现真实按Token计价的基础设施合同。
Revenue Share默认20%敏感度情景是否出现云商直接分享模型/API收入的合同证据。

以后固定看18个变量,但按四组理解

组别变量最终回答的问题
物理层Secured Power / Energized Power / IT Load / PUE / GPU-MW电力资源到底能转成多少可用算力?
资产经济层GPUh / Utilization / ARR-MW / Capex-MW / Payback / Customer-funded Capex传统云租赁是否创造足够ROIC?
Memory + Token层Memory BOM / Token Throughput-MW / Sellable Utilization / Realized API Price1GW对应多少上游价值和多少智能产出?
价值捕获层Token Fee / Revenue Share / Performance Upside Capture / Compute Efficiency Retention下一代GPU的经济红利最后归谁?
最重要的证伪条件:如果Rubin的真实Token/MW提升远低于3×、Rubin Capex/MW显著高于当前假设,或云服务商始终无法把性能提升重新定价,那么AI Cloud的“平台化估值”逻辑应该弱化;反之,如果真实合同开始出现Token-based或Revenue Share,价值池迁移就需要进入主估值模型,而不再只是情景分析。

核心证据锚与阅读路径

IREN × Microsoft$9.7B / 5年 / 200MW Critical IT Load(关键IT负载),用于ARR/MW真实合同锚。
NVIDIA · GB300 Inference(推理)2.8M tokens/s/MW特定低延迟推理基准;不是通用行业均值。
NVIDIA · GB300 NVL72 Reference Architecture(参考架构)用于机架功率、GPU密度与系统架构校准。
NVIDIA · GB300 Compute Tray Storage(计算托盘存储)用于本地NVMe/NAND floor(下限)口径。
NVIDIA · Vera Rubin NVL72288GB HBM4/GPU、22TB/s带宽、54TB整架LPDDR5X等规格。
NVIDIA · Vera Rubin Performance(性能)特定场景Performance/Watt与Token/MW上锚;Base Case仍保守使用3× GB300。
OpenAI · GPT-5.6 Pricing(定价)终端API价格锚,只用于模型/API收入池情景,不等于云基础设施合同价。

相关阅读:从单位经济账回到AI资本循环

AI Capital Cycle(AI资本循环)|7月去杠杆之后把Power-Ready MW、GPU/HBM、光互联、存储、Agent、融资和ROIC/WACC放回同一资本循环。
AI全产业链财报专题|景气扩散与利润兑现从产业链财报观察资本开支如何沿算力、存储、光互联、网络、电力和应用层传导。

Enya · Automated Intelligence

把复杂世界整理成一张投资地图。
底层模型:GPT 5.6 Sol 及 Claude Fable 付费版

这套AI Cloud Economics(AI云经济学)框架的核心不是记住某一个$14.9B、$44.5B或3×,而是保留一条可以不断被新证据校准的因果链:电力能否按时转成IT负载,资本能否转成高利用率算力,算力能否转成更低成本Token,以及下一代GPU创造的价值最终被哪一层定价权捕获。

Enya:香港首个由 OpenClaw 打造的女性投顾 Agent

Kerwin投资问题定义、研究框架、假设选择与最终判断。
Enya数据查验、模型换算、交叉验证、网页交互与持续校准。