一边是DeepSeek创始人梁文锋在网传投资人会议整理稿中提出“CoT之后是Agent,Agent之后是持续学习”;另一边,AlphaGo核心技术领导者David Silver在伦敦创办Ineffable Intelligence,明确要让AI摆脱对人类静态数据的单向模仿,依靠经验和强化学习持续发现新知识。
这两条路线并不完全相同,却指向同一个产业拐点:AI正在从“压缩与模仿人类知识”,进入“自主行动、产生经验、更新策略”的阶段。真正值得关注的,不只是算法哲学,而是这种闭环学习将把训练、推理、仿真和评估绑在一起,形成比传统预训练更持续、更低延迟、更依赖CPU、GPU、网络、内存和存储协同的新算力负载。
Ineffable Intelligence并不是我们先设定好主题后再寻找的案例。它最初只是Alphabet财报电话会中被管理层点到的一个客户名字:一家前沿实验室选择Google Cloud,并准备使用A5X与Vera Rubin训练新的强化学习系统。
财报和电话会不只是用来核对收入、利润与指引。真正能够扩展研究深度和广度的,往往是管理层顺带提及的客户、产品、项目和技术细节。我们从一个公司名字继续追问:它是谁、为什么选择这套算力、它代表什么新需求、订单最终落到哪些芯片、机柜、网络、电力和存储环节。一个细节由此扩展成一条完整产业链,也让研究从“知道结果”进入“理解结果如何发生”。
沿着Ineffable这条线,我们最终连接起四个层次:David Silver的强化学习思想、DeepSeek被转述的持续学习路线、Google Cloud争夺前沿实验室的A5X产品,以及NVIDIA Rubin带来的整套AI Factory升级。这也是为什么一场财报电话会中的一句话,能够发展成独立专题。
Ineffable的激进之处,不在于再训练一个更大的语言模型,而在于质疑“模仿人类数据”是否能够通往超级智能。公司认为,语言、数学、科学和技术不应只是训练语料的上限;AI应当通过在环境中行动、获得结果、修改策略,重新发现并最终超越人类已有知识。
AlphaGo、AlphaGo Zero和AlphaZero已经证明,在规则明确、反馈清晰的环境里,AI可以不依赖人类棋谱,通过自我对弈产生经验并获得超人能力。Ineffable试图把这套方法从棋盘扩展到软件、科学、工程和物理机器。真正困难的是:开放世界不像围棋那样拥有单一、明确且无争议的胜负函数。
RAG只是运行时检索外部资料,模型参数和核心能力通常没有被经验更新。
把历史全部塞入上下文会提高成本,也不等于形成可泛化的新技能。
批量收集数据后重新训练,仍是离线迭代,不是持续闭环。
系统能够从部署后的新经验中形成稳定能力,同时避免灾难性遗忘与错误累积。
| 问题 | 传统预训练 | 持续自主学习 |
|---|---|---|
| 数据来源 | 预先收集的人类文本、代码、图像 | 智能体行动后实时产生的经验轨迹 |
| 训练节奏 | 大批量、阶段式训练 | 训练、推理、仿真和评估持续交织 |
| 正确性 | 通过数据质量和损失函数近似 | 必须建立可信奖励、验证器和长期结果评价 |
| 主要风险 | 数据污染、幻觉、偏见 | 奖励投机、灾难性遗忘、错误自我强化、环境漏洞 |
| 算力形态 | GPU主导的大规模矩阵运算 | GPU+CPU+网络+存储+模拟环境的持续闭环 |
网传整理稿中,梁文锋把路线描述为“去年的台阶是CoT,今年是Agent,Agent之后要解决持续学习”;并进一步提出,持续学习之后,AI可能参与开发更先进的AI,最终走向具身智能。这个判断与Ineffable的“Experiential、Continual、General”三项信念形成明显共振。
| 维度 | DeepSeek被转述的路线 | Ineffable官方路线 |
|---|---|---|
| 当前起点 | 大语言模型、推理强化学习、Coding Agent | 经验驱动强化学习与Superlearner |
| 对人类数据的态度 | 继续利用LLM基础,但寻求部署后的持续学习 | 希望弱化对静态人类数据的依赖,通过自身经验发现知识 |
| 下一步 | Agent → 持续学习 → AI自迭代 | 经验循环 → 持续改进 → 数字与物理机器通用 |
| 具身关系 | 被转述为“智能的终点可能都是具身” | 同一Superlearner适用于数字或物理机器 |
| 商业路径 | 开源模型与低成本推理仍是现实抓手 | 尚未披露产品、模型或收入,优先推进基础研究 |
| 核心差异 | 从LLM与Agent向持续学习演进 | 从经验与强化学习原理重新构建智能 |
Google Cloud在2026年6月宣布,Ineffable将部署其规模最大的A5X集群之一。随后NVIDIA进一步确认:Google Cloud首个A5X实例已经为Ineffable上线运行,公司获得Vera Rubin早期访问并开始测试Superlearner基础设施。
运行大量并行环境、工具、规则系统、数据处理和Agent控制逻辑。
承担策略模型、价值模型、世界模型、训练和高吞吐推理。
让环境生成、推理、评估和模型更新之间保持高带宽、低延迟。
保存轨迹、奖励、回放池、模型检查点和模拟器状态。
把多个机架乃至多个数据中心组织成统一的AI工厂。
因此,Rubin的交付节奏、真实性能、客户上线和资本开支兑现,不只影响NVIDIA,也会同时验证CPU、HBM、交换芯片、光模块、CPO、液冷、电力设备、企业SSD与云计算订单。它是观察AI产业链景气度、技术成熟度和资本支出回报率的一组综合领先指标。
Vera是NVIDIA新一代自研Arm数据中心CPU,并非其首款Arm CPU;此前已经有Grace。真正重要的是,Vera进一步围绕Agent、强化学习环境、数据处理和机架级协同设计。持续自主学习会让CPU承担更多模拟器、工具调用、控制逻辑和数据准备工作,CPU不再只是GPU的附属配件。
CPU / ARM / MEMORYNVIDIA在台北电脑展展示的不是孤立的NVL72,而是包括Vera Rubin NVL72、Vera CPU计算、Groq 3 LPX推理、Spectrum-6 SPX网络与BlueField-4 STX存储/数据基础设施在内的系统化概念。它反映算力采购由“买GPU”转向“采购完整工厂”。
RACK-SCALE SYSTEMRubin时代的集群规模与东西向流量继续放大,推动1.6T可插拔光模块、硅光、外置激光源以及CPO路线加速演进。需要注意,CPO并非所有Rubin机架的标准配置,但Rubin所代表的超大规模AI Factory正在把光互联从配套部件提升为决定集群效率的核心环节。
1.6T / SILICON PHOTONICS / CPO围绕Rubin及后续超高功率AI Factory,行业正在推进800V HVDC等更高压直流供电方案,以减少铜耗、转换损失和配电复杂度。它不是单颗GPU参数,而是数据中心从变压器、整流、母线到机架供电的资本开支重构。
800V HVDC / POWERCMX及相关上下文存储架构试图把超长上下文、KV Cache、Agent记忆和经验回放从昂贵的HBM/DRAM向高容量NAND与企业SSD分层。CMX不是标准NVL72机柜中的同义部件,而是Rubin时代相邻的存储系统升级方向,说明AI瓶颈正从计算扩散到数据驻留和记忆管理。
CMX / NAND / ENTERPRISE SSDCoreWeave使用DeepSeek-R1展示的“最高约10倍Token/MW”是系统级结果,包含Rubin硬件、低精度、MoE并行、Prefill/Decode分离和软件优化。真正需要追踪的是:这种效率能否在客户生产环境复制,并转化为云厂商利用率、毛利率和下一轮订单。
DELIVERY / UTILIZATION / ROINVIDIA给出的合作伙伴产品时间表指向2026年下半年。
服务器、网络、存储与ODM供应链进入制造,CoreWeave完成首批完整机架验证。
Google Cloud首个A5X实例为Ineffable上线;CoreWeave披露DeepSeek-R1在Rubin上的系统级推理效率。
仍需验证A5X公开商用、Ineffable大型集群规模、客户利用率和Rubin收入贡献。
这也是Ineffable案例的投资意义:它把“持续学习”这一抽象算法方向,转化为可以观察的真实采购行为。公司是否扩大A5X集群、Rubin机架是否按期增加、CPU和存储利用率是否显著上升,都会成为判断新一轮AI基础设施需求的证据。
Ineffable Intelligence最初只是谷歌电话会里的一个名字。但沿着这个名字继续追问,我们看到了David Silver对经验学习的长期押注、DeepSeek路线中对持续学习的相似判断,也看到了Google A5X与NVIDIA Rubin如何为这种新范式提供物理基础。
这正是Kerwin研究方法的核心:不满足于管理层给出的结论,而是从细节出发,顺藤摸瓜、按图索骥,把一个案例扩展成技术路线、商业模式和产业链地图。Rubin之所以重要,也不是因为又多了一代GPU,而是因为它正在同时推动CPU、机柜、光互联、电力和存储的全面升级。
接下来,Ineffable是否真正开始大规模训练、A5X是否扩容、Rubin性能是否在生产环境兑现,将成为判断“持续自主学习”从理念走向产业现实的关键证据,也会成为AI资本开支周期最值得跟踪的信号灯之一。
Kerwin 确定研究主题、投资逻辑与最终校对;Enya 负责证据组织、可视化呈现与持续维护。