传统聊天是一次输入、一次推理、一次输出;Agent 会反复规划、调用工具、执行代码、检索数据并验证结果。模型推理可以在远端 GPU 集群完成,但浏览器、Python、Git、文件、数据库和 API 等“手脚”仍需要通用计算。
大模型生成决策,执行层负责代码、浏览器、文件、权限、网络和重试。
并发进程、依赖、仓库、缓存与中间产物持续占用 RAM 与存储。
核心数与 FLOPS 都不够,最终要看完整任务的吞吐、尾延迟和成本。
Agent 不是一个“更会聊天的软件”,而是一组长期运行或按任务生成的计算进程。它把 AI 资本开支从 GPU 单点,扩散到 CPU、DDR/LPDDR、NVMe、网络、虚拟化、对象存储、电力与散热;但收益不会平均分配,只有能降低完整任务成本的环节才真正获得定价权。
它不是全球 Agent 基础设施的统计样本,却是一个很好的机制观察点:同一项 AI 工作同时依赖远端模型与本地执行环境。关键是把事实、推断和未知严格分开。
Microsoft 官方文档把 EPYC 9V74 用于 Azure Dasv6 Dedicated Host:80 个物理核心、144 个可用 vCPU、768GiB RAM。当前沙箱只看到其中 9 个 vCPU,形态上符合“大宿主机切片”。
| 观察层 | Codex 工作沙箱 | Enya / OpenClaw on DigitalOcean | AI 工厂 CPU 机柜 |
|---|---|---|---|
| 核心角色 | 按任务提供隔离执行环境 | 用户持续拥有的 Agent 控制面 | 并发沙箱、数据服务与 GPU 主机 |
| 已知配置 | 9 vCPU / 15GiB / 64GB / 无 GPU | 2 vCPU / 4GB / 新加坡 / Ubuntu | 数千至数万 CPU 核心,配合 GPU、DPU 与高速网络 |
| 生命周期 | 任务型、平台管理 | 长期运行、用户管理 | 7×24 小时、高利用率生产 |
| 最关键资源 | CPU 并发、RAM、临时磁盘、网络 | 稳定性、持久状态、备份、成本 | 每核带宽、机架功耗、尾延迟、GPU 利用率 |
| 共同本质 | 都把 Agent 拆成软件进程、运行时状态、文件、网络连接和受控工具;规模不同,资源逻辑相同。 | ||
Agent 是一个持续反馈环。每多一轮工具调用,就新增一次调度、一次状态读写和一次潜在尾延迟。任何一个环节变慢,都会让昂贵的模型或 GPU 等待。
Python/JS、编译、浏览器、加解密、数据库与隔离。
并发进程、网页、数据帧、缓存与中间状态。
仓库、依赖、索引、日志、产物和检查点。
模型 API、SaaS、数据库、对象存储与多 Agent。
Transformer、视觉、语音和高密度矩阵计算。
模型上下文与 KV Cache 通常位于推理服务的 GPU/HBM 或服务器内存;这个工作沙箱的 15GiB RAM 主要承载工具、代码、网页、数据和执行状态。二者都重要,但由不同基础设施层负责。
Intel、AMD 守通用计算;NVIDIA 把 CPU 纳入 AI 工厂;Qualcomm、MediaTek 争夺端侧 Agent;Arm 既提供底层 IP,又进入成品服务器 CPU。
| 厂商 | 代表产品 | 主战场 | Agent 设计抓手 | 状态与判断 |
|---|---|---|---|---|
| Intel ↗ | Xeon 6+ / Core Ultra Series 3 | x86 云端 + PC | P-core / E-core 分线;18A;高密度容器;应用级能耗遥测 | Xeon 6+ 已量产 兼容性与企业渠道最强,以核心密度守云端基本盘。 |
| AMD ↗ | EPYC 9005 / Venice / Ryzen AI | x86 云端到端侧 | Chiplet、高核心密度、SMT、内存带宽与统一内存 | 9005 量产;Venice 爬坡 当前最均衡的通用 Agent CPU 路线。 |
| NVIDIA ↗ | Vera / Vera Rubin / RTX Spark | AI 工厂 + 个人 Agent | 88 核 Olympus、1.2TB/s LPDDR5X、1.8TB/s CPU–GPU 一致性互联 | Vera 生产中 CPU 的任务是缩短执行环并提高 GPU 利用率。 |
| Arm ↗ | AGI CPU / Lumex C1 | 底层 IP + 成品服务器 CPU | 136 核、DDR5-8800、PCIe 6 / CXL 3;端侧 SME2 | AGI CPU 开放订购 从卖图纸走向卖硅片,扩大价值量也改变生态关系。 |
| Qualcomm ↗ | X2 Elite / 8 Elite Gen 5 / C1000 | 端侧为主,远期云端 | Oryon、80 TOPS NPU、始终在线;服务器规划 250+ 核 | 端侧量产;C1000 预计 2028 服务器是高弹性但低确定性的远期选择权。 |
| MediaTek ↗ | Dimensity 9500 / RTX Spark 共研 | 手机、边缘与定制 SoC | Arm C1 全大核、NPU 990、连接与功耗;参与 NVIDIA SoC | 手机量产;RTX Spark 秋季 价值在端侧规模和高效 SoC,而非正面竞逐服务器。 |
软件兼容、云与企业渠道决定近期收入确定性。
高带宽内存与一致性互联,直接优化 Agent 执行环。
从 IP 授权进入成品硅片,提高价值量,也带来渠道张力。
手机与 PC 上的隐私、持续感知和跨应用 Agent。
并发 Agent 的成本常常不是模型权重本身,而是大量分散、不断变化的执行状态。容量、带宽、延迟、IOPS 与持久性必须一起看。
关注 GB / Agent、可用内存、OOM 率和并发沙箱密度。
关注 GB/s / core、满载 IPC、NUMA 与 CPU–GPU 搬运。
连续几十至几百步后,P95/P99 与随机 I/O 会被放大。
关注 RPO/RTO、快照、写入耐久、日志和审计责任。
GPU 已经从单卡 FLOPS 走到 NVL72 整机柜;CPU 也必须从核心与 GHz,走向插槽、服务器、机柜与完整任务。不同 CPU 的峰值数字只有在相同软件、内存、功耗和 SLA 条件下才有可比性。
| 指标 | 回答的问题 | Agent时代重要性 |
|---|---|---|
| 持续单线程性能 | 一项工具调用、编译或 Python 步骤多快结束? | ★★★★★ |
| 每核内存带宽 | 增加核心后,是否因抢内存而失速? | ★★★★★ |
| P95 / P99 步骤延迟 | 多轮 Agent 链条最慢环节有多慢? | ★★★★★ |
| Agent / 沙箱并发密度 | 同一服务器或机柜能运行多少隔离环境? | ★★★★★ |
| CPU–XPU 一致性带宽 | 数据搬运是否让昂贵加速器等待? | ★★★★☆ |
| 每任务能耗与机柜功率 | 持续 Agent 负载的电力与冷却成本? | ★★★★★ |
| 迁移与运维成本 | x86 / Arm、CUDA / ROCm 切换要付出什么? | ★★★★☆ |
任何一个乘数接近零,堆更多 GPU 都无法产生同等比例的业务价值。
这不意味着所有 CPU、内存和存储公司都会同等受益。真正的价值捕获取决于产品是否进入高利用率 Agent 系统,以及能否把技术优势转化为更低的每任务成本。
| 资本开支层 | 需求机制 | 最有用的领先指标 |
|---|---|---|
| CPU / 系统 | 并发沙箱、浏览器、代码、数据库与 GPU 喂数 | Agent/机柜、每核带宽、GPU 空转率、任务/美元 |
| 内存 | 工作集、KV/缓存、并发状态与数据搬运 | GB/服务器、GB/s/核、HBM/DDR 合约价与利用率 |
| NVMe / 对象存储 | 仓库、索引、长期记忆、日志、产物与审计 | 随机 IOPS、写入量、对象存储增速、快照/恢复频率 |
| 网络 / DPU / 光互联 | 分布式推理、多 Agent、数据与安全隔离 | 东西向流量、NIC 速率、DPU 渗透、光端口出货 |
| 电力 / 散热 | 高密度 CPU + GPU 机柜的部署约束 | 机柜 kW、液冷附着率、交付周期与电力可用率 |
这个 9 vCPU 沙箱只能证明机制,不能证明市场规模;但机制很清楚:当 AI 开始浏览、编码、取数、交易、验证和长期运行,GPU 之外的每一层都会进入关键路径。
投资者下一步不应只问“谁的核心最多”,而应问:谁能让一个完整 Agent 任务以最低成本、更低尾延迟和更高可靠性完成?
跨厂商性能数字多为各公司自测,测试对象与系统配置不统一。本专题用它们解释设计方向,不把厂商倍数直接视为可横比的投资结论。