← 返回首页
KERWIN TEAM PRESENTS

Agent时代的计算底座
研究简报

报告发布日期:2026年7月15日
本文由 Kerwin 团队自动化呈现:Kerwin 确定研究主题及校对逻辑,OpenClaw 打造的 Enya 全程自动化编码实现。
底层 AI 模型:GPT-5.5 及 Claude 付费版。Enya:香港首个由 OpenClaw 打造的女性投顾 Agent。
2026 KERWIN · AI INFRASTRUCTURE
Agent 不是只吃 GPU从一个虚拟沙箱,看 CPU、内存与存储的再定价
本专题源自我们委托 GPT Work 制作《Stripe 支付生态全景》的真实过程:为了完成这项长篇研究任务,Work 获得了一个带虚拟 CPU、内存与磁盘的独立沙箱。由此我们追问——当 AI 不只是回答,而是检索、编码、核验并发布网页时,究竟需要怎样的计算底座?
ONE-LINE THESISGPU 决定模型能“想”多快;CPU、内存、存储和网络决定 Agent 能“做”多快。
LIVE OBSERVATION / WORK SANDBOX
ARCHx86_64
CPU9 vCPU
HOSTAMD EPYC 9V74
MEMORY15 GiB / no swap
DISK64 GB virtual block
GPUnot exposed
2026年7月15日 · Agent 计算基础设施专题 · 研究起点:Stripe 支付生态全景 ↗

CPU 不是重新取代 GPU,而是重新进入系统关键路径

传统聊天是一次输入、一次推理、一次输出;Agent 会反复规划、调用工具、执行代码、检索数据并验证结果。模型推理可以在远端 GPU 集群完成,但浏览器、Python、Git、文件、数据库和 API 等“手脚”仍需要通用计算。

9
当前沙箱可见 vCPU
15 GiB
工具与状态工作内存
64 GB
虚拟块设备容量
0
本地暴露 GPU
01推理与执行分离

大模型生成决策,执行层负责代码、浏览器、文件、权限、网络和重试。

02上下文变成系统状态

并发进程、依赖、仓库、缓存与中间产物持续占用 RAM 与存储。

03比较单位升至机柜

核心数与 FLOPS 都不够,最终要看完整任务的吞吐、尾延迟和成本。

投资者应先理解的价值

Agent 不是一个“更会聊天的软件”,而是一组长期运行或按任务生成的计算进程。它把 AI 资本开支从 GPU 单点,扩散到 CPU、DDR/LPDDR、NVMe、网络、虚拟化、对象存储、电力与散热;但收益不会平均分配,只有能降低完整任务成本的环节才真正获得定价权。

一个 9 vCPU 沙箱,究竟能说明什么?

它不是全球 Agent 基础设施的统计样本,却是一个很好的机制观察点:同一项 AI 工作同时依赖远端模型与本地执行环境。关键是把事实、推断和未知严格分开。

可直接观测
任务型虚拟工作机
  • KVM / x86_64 虚拟化特征
  • 9 个可见 vCPU,约 15GiB RAM
  • 无 Swap,64GB 虚拟块设备
  • 没有暴露 NVIDIA GPU
合理推断
来自大型资源池的切片
  • vCPU 更像配额,而非独占芯片
  • 模型推理与工具执行可能分层
  • CPU 标签指向云级大宿主机
无法从沙箱确认
云厂商、地域与调度策略
  • 看不到物理宿主机、超售比例、NUMA 映射、实际云厂商、机房位置,也无法观察平台给不同客户配置资源的内部规则。
AMD EPYC9V74CLOUD-OPTIMIZED HOST SKU

9V74 标签透露了什么?

Microsoft 官方文档把 EPYC 9V74 用于 Azure Dasv6 Dedicated Host:80 个物理核心、144 个可用 vCPU、768GiB RAM。当前沙箱只看到其中 9 个 vCPU,形态上符合“大宿主机切片”。

边界:型号高度相符不等于平台归属已被证明;不能据此确认当前环境一定运行在 Azure,也不能判断地域。
观察层Codex 工作沙箱Enya / OpenClaw on DigitalOceanAI 工厂 CPU 机柜
核心角色按任务提供隔离执行环境用户持续拥有的 Agent 控制面并发沙箱、数据服务与 GPU 主机
已知配置9 vCPU / 15GiB / 64GB / 无 GPU2 vCPU / 4GB / 新加坡 / Ubuntu数千至数万 CPU 核心,配合 GPU、DPU 与高速网络
生命周期任务型、平台管理长期运行、用户管理7×24 小时、高利用率生产
最关键资源CPU 并发、RAM、临时磁盘、网络稳定性、持久状态、备份、成本每核带宽、机架功耗、尾延迟、GPU 利用率
共同本质都把 Agent 拆成软件进程、运行时状态、文件、网络连接和受控工具;规模不同,资源逻辑相同。

Agent 为什么重新放大 CPU、内存和存储?

Agent 是一个持续反馈环。每多一轮工具调用,就新增一次调度、一次状态读写和一次潜在尾延迟。任何一个环节变慢,都会让昂贵的模型或 GPU 等待。

01 · PLAN规划:任务拆分、模型路由、权限与安全策略
02 · THINK推理:GPU / NPU 生成下一步决策
03 · ACT执行:CPU 驱动代码、浏览器、API、数据库与文件
04 · RETRIEVE取数:内存、NVMe、对象存储与网络提供状态
05 · VERIFY验证、测试、风控、重试,再回到规划
CPU执行与编排

Python/JS、编译、浏览器、加解密、数据库与隔离。

MEMORY工作状态

并发进程、网页、数据帧、缓存与中间状态。

STORAGE持久与复现

仓库、依赖、索引、日志、产物和检查点。

NETWORK跨域连接

模型 API、SaaS、数据库、对象存储与多 Agent。

GPU / NPU模型推理

Transformer、视觉、语音和高密度矩阵计算。

不要混淆两种“内存”

模型上下文与 KV Cache 通常位于推理服务的 GPU/HBM 或服务器内存;这个工作沙箱的 15GiB RAM 主要承载工具、代码、网页、数据和执行状态。二者都重要,但由不同基础设施层负责。

六家公司不是在做同一颗 CPU,而是在争夺 Agent 系统的不同控制点

Intel、AMD 守通用计算;NVIDIA 把 CPU 纳入 AI 工厂;Qualcomm、MediaTek 争夺端侧 Agent;Arm 既提供底层 IP,又进入成品服务器 CPU。

厂商代表产品主战场Agent 设计抓手状态与判断
Intel ↗Xeon 6+ / Core Ultra Series 3x86 云端 + PCP-core / E-core 分线;18A;高密度容器;应用级能耗遥测Xeon 6+ 已量产
兼容性与企业渠道最强,以核心密度守云端基本盘。
AMD ↗EPYC 9005 / Venice / Ryzen AIx86 云端到端侧Chiplet、高核心密度、SMT、内存带宽与统一内存9005 量产;Venice 爬坡
当前最均衡的通用 Agent CPU 路线。
NVIDIA ↗Vera / Vera Rubin / RTX SparkAI 工厂 + 个人 Agent88 核 Olympus、1.2TB/s LPDDR5X、1.8TB/s CPU–GPU 一致性互联Vera 生产中
CPU 的任务是缩短执行环并提高 GPU 利用率。
Arm ↗AGI CPU / Lumex C1底层 IP + 成品服务器 CPU136 核、DDR5-8800、PCIe 6 / CXL 3;端侧 SME2AGI CPU 开放订购
从卖图纸走向卖硅片,扩大价值量也改变生态关系。
Qualcomm ↗X2 Elite / 8 Elite Gen 5 / C1000端侧为主,远期云端Oryon、80 TOPS NPU、始终在线;服务器规划 250+ 核端侧量产;C1000 预计 2028
服务器是高弹性但低确定性的远期选择权。
MediaTek ↗Dimensity 9500 / RTX Spark 共研手机、边缘与定制 SoCArm C1 全大核、NPU 990、连接与功耗;参与 NVIDIA SoC手机量产;RTX Spark 秋季
价值在端侧规模和高效 SoC,而非正面竞逐服务器。
近期通用基本盘AMD EPYC × Intel Xeon

软件兼容、云与企业渠道决定近期收入确定性。

系统设计最激进NVIDIA Vera

高带宽内存与一致性互联,直接优化 Agent 执行环。

架构变化最大Arm AGI CPU

从 IP 授权进入成品硅片,提高价值量,也带来渠道张力。

端侧规模入口Qualcomm × MediaTek

手机与 PC 上的隐私、持续感知和跨应用 Agent。

Intel Xeon:服务器平台代际

2017–2021
Skylake → Cascade / Cooper Lake
Xeon Scalable 建立平台化命名。
2021–2024
Ice Lake → Sapphire / Emerald Rapids
制程、HBM 与加速指令演进。
2024–2025
Xeon 6:Sierra Forest / Granite Rapids
E-core 密度与 P-core 性能正式分线。
2026
Xeon 6+:Clearwater Forest
18A、最高 288 E-core,面向云原生与 Agent 密度。

AMD EPYC:从重返服务器到 Chiplet 主线

2017
EPYC 7001 Naples / Zen
AMD 重返服务器。
2019
EPYC 7002 Rome / Zen 2
Chiplet 与 64 核打开份额突破口。
2021
EPYC 7003 Milan / Zen 3
单核性能与企业成熟度提升。
2022–2023
EPYC 9004 Genoa / Bergamo / Siena
Zen 4、Zen 4c、DDR5 与 PCIe 5。
2024–2026
EPYC 9005 Turin → Venice
192 核走向 256 核,并补强至约 1.6TB/s 内存带宽。

第二条主线:不是只要更多内存,而是要更靠近计算、更可持续的状态

并发 Agent 的成本常常不是模型权重本身,而是大量分散、不断变化的执行状态。容量、带宽、延迟、IOPS 与持久性必须一起看。

HBM / GPU Memory模型权重、激活与 KV Cache · 带宽最高、成本最高
DDR / LPDDR / SOCAMMCPU 工作集、并发状态 · 容量与每核带宽重新成为卖点
NVMe / Local SSD依赖、仓库、向量索引、缓存与检查点 · 看 IOPS 与耐久
Object / Persistent Storage长期记忆、日志、数据集、审计与备份 · 看持久性与吞吐成本
01
容量:能同时保留多少状态?

关注 GB / Agent、可用内存、OOM 率和并发沙箱密度。

02
带宽:核心能否持续被喂饱?

关注 GB/s / core、满载 IPC、NUMA 与 CPU–GPU 搬运。

03
延迟:一步动作要等多久?

连续几十至几百步后,P95/P99 与随机 I/O 会被放大。

04
持久性:重启后能否继续?

关注 RPO/RTO、快照、写入耐久、日志和审计责任。

CPU 的比较单位,正在从“芯片参数”升级为“Agent 任务经济性”

GPU 已经从单卡 FLOPS 走到 NVL72 整机柜;CPU 也必须从核心与 GHz,走向插槽、服务器、机柜与完整任务。不同 CPU 的峰值数字只有在相同软件、内存、功耗和 SLA 条件下才有可比性。

LEVEL 1单核IPC · 频率 · 分支预测 · 缓存 · 向量指令
LEVEL 2单插槽核心/线程 · 内存通道 · I/O · TDP · 安全隔离
LEVEL 3服务器NUMA · GPU 挂载 · 内存容量 · NIC / SSD · 可维护性
LEVEL 4机柜核心密度 · kW · 冷却 · 网络 · GPU 利用率
LEVEL 5业务结果完成任务/美元 · P99 时延 · Agent/机柜 · 能耗/任务
指标回答的问题Agent时代重要性
持续单线程性能一项工具调用、编译或 Python 步骤多快结束?★★★★★
每核内存带宽增加核心后,是否因抢内存而失速?★★★★★
P95 / P99 步骤延迟多轮 Agent 链条最慢环节有多慢?★★★★★
Agent / 沙箱并发密度同一服务器或机柜能运行多少隔离环境?★★★★★
CPU–XPU 一致性带宽数据搬运是否让昂贵加速器等待?★★★★☆
每任务能耗与机柜功率持续 Agent 负载的电力与冷却成本?★★★★★
迁移与运维成本x86 / Arm、CUDA / ROCm 切换要付出什么?★★★★☆
AGENT 基础设施的简化投资公式有效任务产出 = 模型推理速度 × GPU 利用率 × CPU 执行效率 × 状态供给能力 ÷ 单任务总成本

任何一个乘数接近零,堆更多 GPU 都无法产生同等比例的业务价值。

投资启示:Agent 把 AI 基础设施从“GPU 单点行情”扩展为系统级资本开支

这不意味着所有 CPU、内存和存储公司都会同等受益。真正的价值捕获取决于产品是否进入高利用率 Agent 系统,以及能否把技术优势转化为更低的每任务成本。

AMD
通用服务器 CPU 的进攻者看 EPYC 份额、Venice 量产、每核带宽与云实例采用。
INTC
x86 企业基本盘与密度路线看 Xeon 6+、18A 良率、E-core 云负载与平台复苏。
NVDA
从 GPU 到整机柜控制面看 Vera–Rubin 导入、CPU–GPU 绑定率与机柜任务吞吐。
ARM
IP 版税向成品服务器 CPU 延伸看 AGI CPU 客户、生态冲突与 Arm 云端份额。
QCOM
端侧 Agent 与服务器远期选择权近期看 PC/手机 NPU,远期看 C1000 兑现节奏。
2454.TW
MediaTek:端侧规模与定制 SoC看旗舰份额、NVIDIA 共研成果与边缘 AI 价值量。
MU
HBM 之外的服务器内存增量看 DDR5、LPDDR/SOCAMM、HBM 与每服务器容量。
VRT
系统瓶颈延伸至电力与散热看高密度机柜、液冷渗透和数据中心交付能力。
资本开支层需求机制最有用的领先指标
CPU / 系统并发沙箱、浏览器、代码、数据库与 GPU 喂数Agent/机柜、每核带宽、GPU 空转率、任务/美元
内存工作集、KV/缓存、并发状态与数据搬运GB/服务器、GB/s/核、HBM/DDR 合约价与利用率
NVMe / 对象存储仓库、索引、长期记忆、日志、产物与审计随机 IOPS、写入量、对象存储增速、快照/恢复频率
网络 / DPU / 光互联分布式推理、多 Agent、数据与安全隔离东西向流量、NIC 速率、DPU 渗透、光端口出货
电力 / 散热高密度 CPU + GPU 机柜的部署约束机柜 kW、液冷附着率、交付周期与电力可用率
值得持续跟踪的验证信号
  • 云厂商披露 Agent 沙箱、CPU 实例或推理服务真实利用率
  • Vera、Arm AGI 与 Venice 获得大规模 OEM / 云部署
  • 每核内存带宽持续上升,LPDDR / SOCAMM 进入更多平台
  • 企业 Agent 上线后,CPU、数据库、对象存储与网络开支同步增加
  • 衡量口径由 TOPS / FLOPS 转向任务/美元与端到端 SLA
可能证伪逻辑的风险
  • Agent 调用量增长,但共享、压缩或缓存使 CPU 增量很弱
  • 执行被 SaaS 平台吸收,企业无需自建基础设施
  • 专用加速器吞并编排与数据处理,通用 CPU 价值量下降
  • 生态迁移慢,使 Arm / 新架构停留在少数超大客户
  • 电力、内存或网络成为更强瓶颈,CPU 升级无法转化为吞吐

结语:Agent 时代不是“CPU 回归”这么简单,而是整个计算栈重新被计价。

这个 9 vCPU 沙箱只能证明机制,不能证明市场规模;但机制很清楚:当 AI 开始浏览、编码、取数、交易、验证和长期运行,GPU 之外的每一层都会进入关键路径。

投资者下一步不应只问“谁的核心最多”,而应问:谁能让一个完整 Agent 任务以最低成本、更低尾延迟和更高可靠性完成?

资料来源与研究边界

跨厂商性能数字多为各公司自测,测试对象与系统配置不统一。本专题用它们解释设计方向,不把厂商倍数直接视为可横比的投资结论。

  1. 本次沙箱现场观测lscpu、free、df 与设备检查 · 2026-07-15
  2. Microsoft Azure:EPYC 9V74 Dedicated Host原始资料 ↗
  3. Intel Xeon 6+官方资料 ↗
  4. AMD EPYC 9005官方资料 ↗
  5. AMD Venice 生产爬坡官方资料 ↗
  6. NVIDIA Vera CPU官方资料 ↗
  7. Arm AGI CPU官方资料 ↗
  8. Qualcomm Dragonfly C1000官方资料 ↗
  9. MediaTek Dimensity 9500官方资料 ↗
  10. NVIDIA × MediaTek RTX Spark官方资料 ↗