Independent Investment ResearchHong Kong · Interactive Entry
Reader Access

两套AI工厂的正面交锋

Google Axion、TPU、Virgo与NVIDIA Vera、Rubin、NVLink的产业链研究。

Auto enter
EnyaClawd Research System底层模型:GPT 5.6 Sol 及 Claude Fable 付费版
KEnyaClawdKerwin Research Hub
AI Infrastructure & Optical Interconnect · 2026年7月24日
KERWIN SIGNAL-CHAIN RESEARCH · AI INFRASTRUCTURE

两套AI工厂的
正面交锋

Google已经把Axion CPU、TPU、ICI与Virgo组织成一套可对外销售的AI Hypercomputer;NVIDIA则以Vera、Rubin、NVLink与Spectrum-X构建AI Factory。下一轮价值迁移将更多发生在系统连接层。

报告发布日期 2026年7月24日研究快照 2026年7月24日作者 Kerwin
研究问题Google是否已形成可替代部分NVIDIA系统价值的完整AI工厂?
证据核心Kakao TPU迁移与Virgo规模化网络
投资映射1.6T、CPO、中际旭创及连接芯片链

结论先行:竞争单位已经从单颗芯片升级为整套AI工厂

01
Google已经形成CPU、加速器、Scale-up、Scale-out和软件的完整闭环。TPU不再只是Google内部降本工具,正在通过Google Cloud转化为第三方客户可采购的基础设施。
02
Virgo的重要性高于单次TPU升级。它解决的是数万颗加速器如何维持高goodput的问题,并把单个数据中心的电力与空间约束转化为跨园区网络需求。
03
Kakao证明TPU具备承接GPU主导工作流的现实可能。关键不在“TPU必然替代GPU”,而在于客户开始拥有第二供应源,算力采购议价能力上升。
04
最清晰的产业增量落在连接层。800G向1.6T升级、102.4T交换芯片、CPO、NIC/DPU和跨数据中心光互联将共同扩大价值池。
9,600TPU 8t单个Superpod规模Verified factGoogle官方技术口径。
134KVirgo单站点连接TPU上限Verified factGoogle官方网络口径。
47 Pb/sVirgo非阻塞双向剖分带宽Verified fact用于判断网络层价值量。
2.7×Kakao从v5e升级Trillium后的吞吐提升Company-reported不是TPU相对GPU的直接比较。

必须先校准:Virgo并不直接等于NVLink

投资映射容易把Google的Axion、TPU、Virgo粗略对应NVIDIA的Vera、Rubin、NVLink。技术上应进一步拆成Scale-up、Scale-out和Scale-across三个层级。

CPU
Google AxionAgent Sandbox、微服务、工具调用与通用云计算。
VS
NVIDIA Vera围绕Rubin数据移动、主机计算和机架协同设计。
加速器
TPU 8t / 8i自研ASIC,分别偏训练及推理/强化学习。
VS
Rubin GPU通用AI计算与CUDA生态,系统适配面更广。
Scale-up
TPU ICI + OCS芯片、Cube、Pod和Superpod内部紧耦合互联。
NVLink 6 + NVLink Switch机架内形成高带宽GPU计算域。
Scale-out
Virgo NetworkPod与机架之间的RDMA东西向网络。
Spectrum-X / Quantum-X把多个NVL72扩展为SuperPOD。
Scale-across
Virgo + Pathways / JAX把多个园区组织成逻辑训练集群。
Spectrum-XGS连接相距数百公里的数据中心。
Kerwin inference

如果讨论机架内部带宽,TPU ICI更接近NVLink;如果讨论机架之间和跨园区扩展,Virgo更接近Spectrum-X、Quantum-X与Spectrum-XGS。1.6T和CPO的主要增量由后两层驱动。

维度Google路线NVIDIA路线投资含义
系统形态TPU、Axion与NVIDIA A5X并存高度整合的参考架构和整机系统Google强调异构选择和云毛利;NVIDIA强调性能确定性
软件护城河JAX、XLA、Pathways,并扩大PyTorch、vLLM支持CUDA、NCCL、Dynamo与成熟开发者生态软件可迁移性决定TPU份额提升速度
商业关系部分工作负载以TPU替代GPU,同时销售RubinGoogle既是大客户,也是潜在替代者客户与竞争者身份同时存在

Kakao案例:TPU开始从内部能力变成第三方客户的现实选择

Kakao面对的是大量模型厂商共同面对的约束:GPU容量、电力、预算和扩展能力接近上限,同时又要训练具备本土语言能力并能进入真实产品的大模型。

约束出现
既有GPU环境触及扩展边界
算力供给、电力和预算共同限制训练规模。
工具迁移
采用JAX、XLA、MaxText、XPK与Grain
迁移的关键成本来自软件栈、数据管线和训练方法,而不是简单更换芯片。
结果验证
以2.1B从零训练及8B至9.8B继续预训练进行对照
Kakao披露其模型质量可与既有GPU Megatron-LM训练结果比较。
性能升级
从TPU v5e升级Trillium后吞吐提升2.7倍
该数字是TPU代际升级,不应被解释为TPU相对GPU提升2.7倍。
GPU容量、电力与预算形成约束
客户承担一次性迁移成本,获得第二算力供应源
Google扩大TPU外部利用率与Cloud收入
GPU仍增长,但超大云厂商内部份额与议价权发生变化

Virgo的重要意义:把数据中心园区变成一台计算机

AI集群规模上升后,昂贵加速器有越来越多时间消耗在通信等待、拥塞、尾延迟、故障恢复和数据供应。Virgo试图把网络从配套设施升级为“有效算力乘数”。

Scale-up:TPU ICI与OCS
连接芯片、Cube与Superpod,追求低延迟紧耦合。
Scale-out:Virgo Fabric
连接Pod和机架,采用高端口密度、扁平两层与多平面故障隔离。
Front-end:Jupiter与存储
负责数据输入、检查点、通用计算与外部服务访问。
Scale-across:Pathways / JAX
跨园区组织百万级逻辑训练集群,绕开单一园区的物理上限。

产业链价值如何传导

瓶颈系统要求受益环节需验证变量
交换容量更高radix与102.4T级交换ASICBroadcom、Marvell、NVIDIA网络具体客户供应关系与量产节奏
端点数据移动RDMA、拥塞控制、故障隔离NIC、DPU、Retimer端口数量、每端口速率、系统利用率
机架间连接800G向1.6T升级光模块、DSP、EML、硅光200G/lane良率与价格下降
跨园区连接更长距离、低延迟与相干光ZR/ZR+、DCI、相干DSP真实跨站点goodput与客户采用

从Virgo自然走向1.6T与CPO:可插拔和共封装将长期并存

当交换芯片从51.2T迈向102.4T,单端口速率需要从400G、800G继续升级到1.6T。采用8×200G PAM4可以提高端口密度,但也把功耗、前面板空间和高速电通道损耗推向新的边界。

连接场景主要技术光学含义投资方向
机架内部NVLink、铜缆、背板、短距电连接不能把全部NVLink带宽直接折算为光模块高速铜、连接器、Retimer
机架到机架Virgo、Spectrum-X、InfiniBand、Ethernet800G向1.6T升级的核心区域光模块、DSP、EML/硅光、NIC
高radix交换层102.4T级交换ASIC前面板功耗与密度推动CPOCPO光引擎、外置激光源、光纤阵列
跨园区DCI、ZR/ZR+、Scale-across更长距离相干光需求上升相干DSP、PIC与传输设备
Kerwin inference

CPO不会立即消灭1.6T可插拔模块。近期更可能出现分层并存:可维护性和标准化要求较高的场景继续使用可插拔,功耗与密度约束最强的高端交换层率先采用CPO。

投资映射:平台、连接层与物理基础设施应分层配置

标的/环节受益逻辑关键验证主要风险
GOOGLTPU降低内部与Cloud推理成本,Virgo提高系统利用率,Axion承接Agent CPU负载TPU外部客户、Cloud积压订单、折旧与利润率资本开支回报慢于预期
NVDAVera Rubin从GPU扩展至CPU、NVLink、DPU和Spectrum-X系统收入Rubin真实交付、Token/MW、网络收入超大云自研ASIC份额提升
ARMAxion与Vera共同扩大Arm在数据中心CPU的渗透云实例采用、授权与版税增长x86兼容性仍占主导
AVGO / MRVL定制ASIC、交换芯片、SerDes与光DSP受益于102.4T和200G/lane客户项目、量产与产品组合供应关系不透明、价格竞争
COHR / LITE / 300308.SZ800G、1.6T、EML、硅光与CPO共同扩大光学价值池1.6T收入占比、良率、客户认证CPO重分配传统可插拔价值
ETN / VRT / GEV跨园区扩展和高功率机架继续拉动配电、液冷与电网设备订单转收入、交期与利润率数据中心建设延期

中际旭创的准确定位

Verified fact旗下InnoLight产品组合已覆盖1.6T OSFP224,典型结构为8路200G PAM4。

Kerwin inference中际旭创是全球AI Scale-out网络从800G向1.6T升级的A股高弹性映射,不能被简单写成Google Virgo供应商故事。

Unresolved目前没有公开证据证明中际旭创是Virgo或TPU 8t的直接供应商。投资判断应聚焦产品能力、客户认证、良率与收入结构。

什么会证伪这条投资主线

TPU软件迁移仍然困难

PyTorch、vLLM和SGLang兼容只停留在“可以运行”,生产效率无法接近GPU。

Virgo规模能力未转化为真实利用率

理论百万芯片连接被故障、尾延迟、调度和跨站点通信抵消。

1.6T放量晚于市场预期

800G生命周期延长,客户延迟升级,价格下降快于成本改善。

CPO商业化受维护与良率限制

热管理、维修和供应链重构使大规模部署继续后移。

监测仪表盘

01
TPU 8t / 8i商用区域、定价与客户判断TPU是否从内部能力转化为持续外部收入。
TPU
02
Kakao是否扩大Kanana在TPU上的训练与推理确认案例是否从技术验证进入持续采购。
Customer
03
Virgo支持A5X Rubin的真实集群规模观察Google能否同时获取TPU和NVIDIA工作负载。
Virgo
04
102.4T交换芯片与1.6T端口出货从样品和认证转向规模部署的时间点。
Network
05
中际旭创1.6T收入占比与200G/lane良率验证技术领先是否转化为收入和利润率。
300308.SZ
06
Google Cloud资本开支、折旧与利润率最终检验AI Hypercomputer是否形成资本回报。
ROI

主要英文资料与下一条研究路径

01
Google Cloud|AI infrastructure at Next ’26支持TPU 8t/8i、Axion、A5X、Virgo与软件框架信息。
02
Google Cloud|Introducing Virgo Network支持134K TPU、47 Pb/s、网络分层与跨站点扩展口径。
03
Google Cloud / Kakao|JAX and Cloud TPU Journey支持Kakao迁移路径、模型验证与2.7倍吞吐口径。
04
NVIDIA|Vera Rubin NVL72支持Vera、Rubin、NVLink与系统架构对照。
05
InnoLight|1.6T OSFP224支持中际旭创旗下1.6T、8×200G产品能力。

相关研究路径

EnyaClawd
Enya:香港首个由 OpenClaw 打造的女性投顾 Agent
底层模型:GPT 5.6 Sol 及 Claude Fable 付费版

EnyaClawd是Kerwin的研究与呈现系统,负责把公开证据、产业链因果、投资映射与持续监测连接成可复核的研究页面。

Kerwin确定研究主题、投资问题、判断边界并完成最终校对。
Enya组织证据、区分事实与推断、构建可视化并维护后续验证变量。