EnyaClawd · 返回研究首页
KERWIN TEAM PRESENTS · NEXT AI PARADIGM

从模仿到
持续自主学习

报告发布日期:2026年7月23日 · 更新:2026年7月23日
Ineffable Intelligence、DeepSeek路线图与NVIDIA Rubin / Google Cloud A5X的下一代AI赌注。Kerwin投顾视角。
SUPERLEARNER · CONTINUAL LEARNING · VERA RUBIN

当“Agent之后是持续学习”,遇上David Silver的Superlearner

一边是DeepSeek创始人梁文锋在网传投资人会议整理稿中提出“CoT之后是Agent,Agent之后是持续学习”;另一边,AlphaGo核心技术领导者David Silver在伦敦创办Ineffable Intelligence,明确要让AI摆脱对人类静态数据的单向模仿,依靠经验和强化学习持续发现新知识。

Kerwin核心判断

这两条路线并不完全相同,却指向同一个产业拐点:AI正在从“压缩与模仿人类知识”,进入“自主行动、产生经验、更新策略”的阶段。真正值得关注的,不只是算法哲学,而是这种闭环学习将把训练、推理、仿真和评估绑在一起,形成比传统预训练更持续、更低延迟、更依赖CPU、GPU、网络、内存和存储协同的新算力负载。

$1.1BIneffable种子轮融资
A5X已运行首个实例为Ineffable上线
10×Rubin对GB200的Token/MW峰值优势
4阶段CoT → Agent → 持续学习 → 自迭代
01 · RESEARCH ORIGIN

从谷歌电话会里的一个名字,顺藤摸瓜到下一代AI范式

Ineffable Intelligence并不是我们先设定好主题后再寻找的案例。它最初只是Alphabet财报电话会中被管理层点到的一个客户名字:一家前沿实验室选择Google Cloud,并准备使用A5X与Vera Rubin训练新的强化学习系统。

K

这正是Kerwin一贯的研究方法:顺藤摸瓜,按图索骥

财报和电话会不只是用来核对收入、利润与指引。真正能够扩展研究深度和广度的,往往是管理层顺带提及的客户、产品、项目和技术细节。我们从一个公司名字继续追问:它是谁、为什么选择这套算力、它代表什么新需求、订单最终落到哪些芯片、机柜、网络、电力和存储环节。一个细节由此扩展成一条完整产业链,也让研究从“知道结果”进入“理解结果如何发生”。

顺藤摸瓜按图索骥从案例扩展产业链从细节建立领先指标

沿着Ineffable这条线,我们最终连接起四个层次:David Silver的强化学习思想、DeepSeek被转述的持续学习路线、Google Cloud争夺前沿实验室的A5X产品,以及NVIDIA Rubin带来的整套AI Factory升级。这也是为什么一场财报电话会中的一句话,能够发展成独立专题。

01
思维链 CoT模型学会把复杂问题展开成中间推理步骤。
02
Agent模型开始调用工具、操作软件并完成多步骤任务。
03
持续学习系统从工作结果中积累经验,而非每次重新装载全部上下文。
04
AI自迭代模型参与改进模型、环境、算法与研究流程。
重要口径:网传《梁文锋四小时投资人会议实录》不是DeepSeek官方发布的逐字稿。原始整理方明确说明,内容来自多方收集的有限素材,部分词句只保留原意、与现场原话可能存在差异。因此本文把它作为路线观点的二手整理材料,而不是可逐字归因的正式讲话。
网传整理稿用于呈现梁文锋被转述的路线判断,必须附带真实性与转述误差提示。
公司官方主张Ineffable官网直接提出“从自身经验发现知识”的Superlearner目标。
硬件落地证据Google、NVIDIA与CoreWeave披露A5X实例、Rubin机架和实测硅片进展。
02 · THE COMPANY

Ineffable Intelligence:把AlphaZero哲学扩展到开放世界

IneffableIntelligenceCreating the world’s first superlearners
创始人David Silver,原Google DeepMind强化学习负责人、AlphaGo与AlphaZero核心技术领导者。
所在地英国伦敦,2026年正式走出隐身状态。
资金完成11亿美元种子轮,为欧洲历史上规模最大的种子轮之一。
任务开发能够从自身经验持续发现知识与技能的“超级学习者”。
云合作Google Cloud为优先云合作伙伴,部署大型A5X集群。
硬件Google A5X裸金属实例,底层为NVIDIA Vera Rubin NVL72。

Ineffable的激进之处,不在于再训练一个更大的语言模型,而在于质疑“模仿人类数据”是否能够通往超级智能。公司认为,语言、数学、科学和技术不应只是训练语料的上限;AI应当通过在环境中行动、获得结果、修改策略,重新发现并最终超越人类已有知识。

名称含义:“Ineffable”意为难以用语言完整描述。公司认为,超级学习者未来发现的知识可能超出人类现有概念与语言体系。

为什么David Silver的背景具有决定性意义

AlphaGo、AlphaGo Zero和AlphaZero已经证明,在规则明确、反馈清晰的环境里,AI可以不依赖人类棋谱,通过自我对弈产生经验并获得超人能力。Ineffable试图把这套方法从棋盘扩展到软件、科学、工程和物理机器。真正困难的是:开放世界不像围棋那样拥有单一、明确且无争议的胜负函数。

03 · THE LEARNING LOOP

Superlearner不是“更长记忆”,而是让经验真正改变能力

环境与任务软件、模拟器、实验系统、机器人或真实业务流程。
行动与经验模型采取行动,产生轨迹、反馈、奖励、失败和新问题。
策略更新评估经验、修改策略与能力,再次进入环境验证。
持续循环:新策略 → 新行动 → 新经验 → 新知识,而不是每次重新提示同一个模型
RAG不等于持续学习

RAG只是运行时检索外部资料,模型参数和核心能力通常没有被经验更新。

超长上下文不等于持续学习

把历史全部塞入上下文会提高成本,也不等于形成可泛化的新技能。

定期微调不等于在线学习

批量收集数据后重新训练,仍是离线迭代,不是持续闭环。

真正的持续学习

系统能够从部署后的新经验中形成稳定能力,同时避免灾难性遗忘与错误累积。

它为什么比静态预训练更难

问题传统预训练持续自主学习
数据来源预先收集的人类文本、代码、图像智能体行动后实时产生的经验轨迹
训练节奏大批量、阶段式训练训练、推理、仿真和评估持续交织
正确性通过数据质量和损失函数近似必须建立可信奖励、验证器和长期结果评价
主要风险数据污染、幻觉、偏见奖励投机、灾难性遗忘、错误自我强化、环境漏洞
算力形态GPU主导的大规模矩阵运算GPU+CPU+网络+存储+模拟环境的持续闭环
04 · TWO ROUTES, ONE DIRECTION

DeepSeek与Ineffable:相同的终点判断,不同的出发方式

网传整理稿中,梁文锋把路线描述为“去年的台阶是CoT,今年是Agent,Agent之后要解决持续学习”;并进一步提出,持续学习之后,AI可能参与开发更先进的AI,最终走向具身智能。这个判断与Ineffable的“Experiential、Continual、General”三项信念形成明显共振。

维度DeepSeek被转述的路线Ineffable官方路线
当前起点大语言模型、推理强化学习、Coding Agent经验驱动强化学习与Superlearner
对人类数据的态度继续利用LLM基础,但寻求部署后的持续学习希望弱化对静态人类数据的依赖,通过自身经验发现知识
下一步Agent → 持续学习 → AI自迭代经验循环 → 持续改进 → 数字与物理机器通用
具身关系被转述为“智能的终点可能都是具身”同一Superlearner适用于数字或物理机器
商业路径开源模型与低成本推理仍是现实抓手尚未披露产品、模型或收入,优先推进基础研究
核心差异从LLM与Agent向持续学习演进从经验与强化学习原理重新构建智能
不能简单等同:DeepSeek仍处于LLM、推理模型和Agent工程体系中;Ineffable则更接近对LLM主导范式的根本性挑战。两者的交集是“模型不能永远只依赖静态人类数据”,而不是已经采用同一套算法或训练系统。
05 · WHY A5X

Google A5X:不是一张GPU租赁账单,而是一套持续学习工厂

Google Cloud在2026年6月宣布,Ineffable将部署其规模最大的A5X集群之一。随后NVIDIA进一步确认:Google Cloud首个A5X实例已经为Ineffable上线运行,公司获得Vera Rubin早期访问并开始测试Superlearner基础设施。

Google Cloud A5XBARE METAL · VERA RUBIN · VIRGO
NVIDIA Vera Rubin NVL7272颗Rubin GPU、36颗Vera CPU与NVLink 6机架级互联。
Google Virgo Network面向数万颗加速器的单站点扩展,并为跨站点协同设计。
Managed Lustre与存储持续向训练、轨迹回放、模型检查点与仿真环境供给数据。
GKE与NVIDIA Dynamo调度训练、推理、Prefill/Decode、评估和Agent工作负载。
A5X是Google Cloud的裸金属实例类别,不是Google自研芯片;其底层加速器是NVIDIA Vera Rubin,Google提供网络、存储、调度、机房和云服务能力。

为什么持续学习特别适合Vera CPU+Rubin GPU

环境与仿真
Vera CPU

运行大量并行环境、工具、规则系统、数据处理和Agent控制逻辑。

模型计算
Rubin GPU+HBM4

承担策略模型、价值模型、世界模型、训练和高吞吐推理。

闭环通信
NVLink 6+高速网络

让环境生成、推理、评估和模型更新之间保持高带宽、低延迟。

经验沉淀
企业SSD+并行文件系统

保存轨迹、奖励、回放池、模型检查点和模拟器状态。

规模化运行
Virgo+云调度

把多个机架乃至多个数据中心组织成统一的AI工厂。

06 · RUBIN AS THE SIGNAL LIGHT

为什么我们持续追踪Rubin:它是当前AI投资最重要的产业信号灯之一

Rubin不是一次简单的GPU换代,而是AI工厂从芯片、机柜、网络、电力到存储的系统性升级。

因此,Rubin的交付节奏、真实性能、客户上线和资本开支兑现,不只影响NVIDIA,也会同时验证CPU、HBM、交换芯片、光模块、CPO、液冷、电力设备、企业SSD与云计算订单。它是观察AI产业链景气度、技术成熟度和资本支出回报率的一组综合领先指标。

01

Vera CPU:CPU重新进入AI系统核心

Vera是NVIDIA新一代自研Arm数据中心CPU,并非其首款Arm CPU;此前已经有Grace。真正重要的是,Vera进一步围绕Agent、强化学习环境、数据处理和机架级协同设计。持续自主学习会让CPU承担更多模拟器、工具调用、控制逻辑和数据准备工作,CPU不再只是GPU的附属配件。

CPU / ARM / MEMORY
02

五类机架:从单一GPU柜走向完整AI Factory

NVIDIA在台北电脑展展示的不是孤立的NVL72,而是包括Vera Rubin NVL72、Vera CPU计算、Groq 3 LPX推理、Spectrum-6 SPX网络与BlueField-4 STX存储/数据基础设施在内的系统化概念。它反映算力采购由“买GPU”转向“采购完整工厂”。

RACK-SCALE SYSTEM
03

1.6T光互联与CPO:带宽成为系统能力上限

Rubin时代的集群规模与东西向流量继续放大,推动1.6T可插拔光模块、硅光、外置激光源以及CPO路线加速演进。需要注意,CPO并非所有Rubin机架的标准配置,但Rubin所代表的超大规模AI Factory正在把光互联从配套部件提升为决定集群效率的核心环节。

1.6T / SILICON PHOTONICS / CPO
04

800V高压直流:电力架构必须跟随机架功率升级

围绕Rubin及后续超高功率AI Factory,行业正在推进800V HVDC等更高压直流供电方案,以减少铜耗、转换损失和配电复杂度。它不是单颗GPU参数,而是数据中心从变压器、整流、母线到机架供电的资本开支重构。

800V HVDC / POWER
05

CMX与存储优化:上下文和经验开始沉淀到NAND层

CMX及相关上下文存储架构试图把超长上下文、KV Cache、Agent记忆和经验回放从昂贵的HBM/DRAM向高容量NAND与企业SSD分层。CMX不是标准NVL72机柜中的同义部件,而是Rubin时代相邻的存储系统升级方向,说明AI瓶颈正从计算扩散到数据驻留和记忆管理。

CMX / NAND / ENTERPRISE SSD
06

真实交付与Token/MW:决定资本开支是否形成回报

CoreWeave使用DeepSeek-R1展示的“最高约10倍Token/MW”是系统级结果,包含Rubin硬件、低精度、MoE并行、Prefill/Decode分离和软件优化。真正需要追踪的是:这种效率能否在客户生产环境复制,并转化为云厂商利用率、毛利率和下一轮订单。

DELIVERY / UTILIZATION / ROI
Kerwin的观察框架:Rubin是一盏“组合信号灯”。绿灯不是发布会演示,而是芯片、机架、网络、电力和存储同时按期交付,客户真正上线,单位电力Token产出提高,并最终进入云厂商和NVIDIA的收入。任何一个环节出现延迟,都可能把瓶颈和投资机会重新分配到其他产业链节点。

当前进度:已经越过样机,但仍未完成全面规模验证

2026年1月
Rubin平台正式发布

NVIDIA给出的合作伙伴产品时间表指向2026年下半年。

2026年5—6月
量产爬坡与整机Bring-up

服务器、网络、存储与ODM供应链进入制造,CoreWeave完成首批完整机架验证。

2026年7月
A5X和真实模型测试出现

Google Cloud首个A5X实例为Ineffable上线;CoreWeave披露DeepSeek-R1在Rubin上的系统级推理效率。

下一阶段
从首批机架扩展到生产集群

仍需验证A5X公开商用、Ineffable大型集群规模、客户利用率和Rubin收入贡献。

07 · INVESTMENT MAP

持续自主学习与Rubin升级,如何扩散到产业链

GPU与HBM策略模型、世界模型、训练和推理继续扩大,对Rubin、HBM4和先进封装形成直接需求。核心算力
CPU、内存与环境计算大量模拟器、工具和Agent控制逻辑提高Vera CPU、DDR与主机内存的重要性。新增权重
网络与光互联NVLink、Spectrum-X、1.6T光模块、硅光和CPO决定集群扩展效率。系统瓶颈
存储与上下文层经验轨迹、回放池、检查点、CMX和上下文分层推动企业SSD与NAND需求。记忆基础设施
电力与液冷机架功率上升推动800V HVDC、变压器、母线、整流、电源和液冷资本开支。物理约束
云平台与调度软件A5X、Virgo、GKE和Dynamo将异构硬件组织成可用服务,决定客户迁移成本与利用率。商业化入口

这也是Ineffable案例的投资意义:它把“持续学习”这一抽象算法方向,转化为可以观察的真实采购行为。公司是否扩大A5X集群、Rubin机架是否按期增加、CPU和存储利用率是否显著上升,都会成为判断新一轮AI基础设施需求的证据。

08 · WHAT TO WATCH

接下来需要跟踪的八个验证点

01
Ineffable是否宣布正式开始训练第一代Superlearner确认基础设施测试何时转为大规模模型训练。
模型进度
02
A5X集群最终规模机架数量、Rubin GPU数量、区域与扩容节奏。
订单规模
03
Google Cloud A5X公开Preview或GA观察区域、定价、预留容量、GKE及存储配置。
产品化
04
Rubin生产环境的Token/MW验证CoreWeave测试能否在不同模型和客户环境复制。
真实性能
05
五类机架和网络系统的交付节奏不只看NVL72,也看CPU、网络、DPU与推理机架配套。
系统交付
06
1.6T、CPO与光源方案观察可插拔光模块和CPO的实际放量边界。
光互联
07
800V HVDC与数据中心电力改造关注电力设备订单、认证和机房落地时间。
电力
08
CMX、企业SSD与上下文存储验证Agent记忆和经验回放是否真正形成NAND增量。
存储
09 · SOURCES

主要资料入口

01
Ineffable Intelligence Official公司任务、Superlearner与Experiential / Continual / General技术信念。
02
Google Cloud London Summit 2026Ineffable与A5X合作、Google Cloud AI基础设施信息。
03
NVIDIA Vera Rubin UpdateRubin机架、云合作伙伴、A5X与早期客户进展。
04
CoreWeave Rubin DeepSeek-R1 TestDeepSeek-R1、Tokens/s/MW与系统级推理效率口径。
05
NVIDIA Rubin Production RampRubin量产爬坡、服务器与供应链合作伙伴。

结语:从一个电话会细节,看见下一轮AI产业链

Ineffable Intelligence最初只是谷歌电话会里的一个名字。但沿着这个名字继续追问,我们看到了David Silver对经验学习的长期押注、DeepSeek路线中对持续学习的相似判断,也看到了Google A5X与NVIDIA Rubin如何为这种新范式提供物理基础。

这正是Kerwin研究方法的核心:不满足于管理层给出的结论,而是从细节出发,顺藤摸瓜、按图索骥,把一个案例扩展成技术路线、商业模式和产业链地图。Rubin之所以重要,也不是因为又多了一代GPU,而是因为它正在同时推动CPU、机柜、光互联、电力和存储的全面升级。

接下来,Ineffable是否真正开始大规模训练、A5X是否扩容、Rubin性能是否在生产环境兑现,将成为判断“持续自主学习”从理念走向产业现实的关键证据,也会成为AI资本开支周期最值得跟踪的信号灯之一。

EnyaClawd
Enya:香港首个由 OpenClaw 打造的女性投顾 Agent
底层模型:GPT 5.6 Sol 及 Claude Fable 付费版

Kerwin 确定研究主题、投资逻辑与最终校对;Enya 负责证据组织、可视化呈现与持续维护。