Frontier Model Economics 1.0从模型财报到数字劳动力市场
智谱与 MiniMax 的公开损益表把模型公司从 Benchmark 拉回真实经济学:Token 是生产要素,Successful Task(成功任务)与 Outcome(结果)才是最终可计价产出。由此,一条从瓦特、算力、模型、Agent、任务到价值捕获与 ROIC 的统一账本开始闭合。
这轮讨论真正改变了什么
起点是智谱、MiniMax 两份财报:收入高速增长,但推理仍是可变成本,研发强度仍远高于成熟 SaaS。沿着这条损益表往下追,我们最终发现,模型公司的核心问题并不是“谁最聪明”,而是“谁能以最低的资本与算力,把智能转化为最多成功任务,并把任务价值留在自己的股东账上”。
财报给出的第一条硬约束:Frontier Model 还不是成熟 SaaS
智谱 2026H1 收入 RMB953.9m、集团毛利率 26.4%、研发 RMB2.131bn;MiniMax 2026H1 收入 US$116.6m、毛利率 17.9%、研发 US$296.9m。两家公司都证明了模型商业化进入高速增长期,同时也证明“软件边际成本接近零”的旧直觉并不适用于当前 Frontier Model:推理消耗真实 Compute,下一代模型又持续吞噬 R&D 与 Training 资本。
因此,传统 SaaS 的 Seats × ARPU → Revenue → EBITDA 不够。模型经济必须先写出生产函数,再谈估值。
物理约束
资本设备
COGS meter
数字劳动力
可交付工作
收入与利润
1.0 的核心会计原则
Task = Revenue Meter:客户最终愿意为“事情完成”付钱。
Token = COGS Meter:后台为完成任务消耗多少推理、工具、Sandbox 与重试资源。
Agent Task Gross Profit = Task Revenue − Inference Tokens − Tool/API − Sandbox/Execution − Retry/Error − Human Review这是 Agent 单位经济学,不等同公司会计报表中的完整毛利润口径;它用于把模型能力转成可比较的任务经济学。
“培养孩子”类比:什么时候模型真正经济成年
一个 Frontier Model 可以具象化为“培养一个孩子”:Pre-training(预训练)像基础教育,Post-training / RL(后训练/强化学习)像大学与职业培训,Benchmark 像考试分数;真正进入 Agent 阶段,才像毕业后开始工作。这个类比的价值在于把前期固定投入、持续推理成本和回本拐点放在同一条时间轴上。
教育账
Education Cost = Pre-training + Post-training + Model R&D。
Intelligence Depreciation:模型“毕业证”的有效期很短,领先代际会快速折旧,因此不能只算训练成本,还要算经济租金持续多久。
就业账
Attributable Revenue → Inference COGS → Attributable Gross Profit。
真正的“成年线”不是收入第一次出现,而是这一代模型产生的毛利开始足以供养下一轮训练与研发。
CSFR|Cohort Self-Funding Ratio = Current Annualized Gross Profit / Annualized Training & R&D EnvelopeCSFR > 1× 可理解为“模型经济成年线”。由于公司通常不披露单一模型代际的训练成本与收入归因,现阶段公司 R&D 只能作为 proxy,不能伪装成精确 Cohort 会计。
Model Cohort Payback = Training + Post-training Investment / Annualized Attributable Gross Profit未来招股书若能提供模型代际成本、推理毛利与产品收入归因,这将比简单 P/S 更接近模型资本效率。
“孙悟空拔毫毛”:真正的指数项来自可复制数字劳动力
Agent 用中国投资者最容易理解的形象,可以看作孙悟空的分身:模型本体负责“脑子与本领”,Agent 是从同一套智能复制出来的执行体。每个分身仍要消耗 Token、Compute、工具调用与运行环境——也就是“法力”——但一个模型可以同时复制成成千上万个工作流实例,这一点与真人劳动力根本不同。
因此,AI 的指数特征未必来自模型智力每年增长 100 倍,更可能来自三个乘数同时发生:智能能力上升 × 并行 Agent 数增加 × 人类监督时间下降。
Concurrent Agent Streams × Success Rate衡量一个模型大脑能够形成多少有效并发数字劳动力。Agent Active Time / Human Supervision Time人类管理一小时,Agent 能自主工作多少小时。Human-Equivalent Productive Hours / Supervisor Hours真正回答“一个真人经理被放大成多少有效劳动力”。组织形态:Commander → Workers → Verifier
未来企业很可能不会让同一个昂贵模型做全部工作。高能力模型负责目标理解、拆解与关键判断,GLM/MiniMax/小模型等低成本 Worker 执行批量任务,再由高级模型或确定性测试做 Verifier。最优问题从“哪个模型第一”变成:
Choose model i that maximizes: P(Successᵢ) × Task Value − Total Execution Costᵢ
把数字劳动力从比喻变成可计量工时
“1 Agent Hour”不能直接等于“模型连续推理一小时”。Agent 会调用浏览器、Terminal、API、Sandbox,也会等待外部系统,还可能拉起多个 Sub-agent。因此必须把物理推理工时与任务墙钟时间分开。
| 单位 | 定义 | 为什么重要 |
|---|---|---|
| Inference Stream Hour (ISH) | 模型真正处于推理流中的一小时。 | 最接近 GPU/Token 的物理供给单位。 |
| Agent Wall Hour | Agent 从接单到交付的实际工作时间,包括工具、等待与执行。 | 更接近数字员工的“出勤工时”。 |
| Useful Work Hour | 真正用于具有经济价值任务的 Agent 工时。 | 把算力利用率与经济利用率分开。 |
| Human-Equivalent Hour | 同样合格成果若由真人完成需要的工时。 | 建立 Agent 与人类劳动价值之间的桥。 |
Agent Wall Hours = Inference Stream Hours / (Inference Duty Cycle × Average Parallel Streams)
这里由此诞生一个关键变量:
UWU|Useful Work Utilization = Economically Useful Agent Hours / Potential Agent HoursGPU 即使满载,也可能在做低价值、重复或失败任务。未来 Token/MW 快速提升后,真正稀缺的可能逐渐变成高价值、可授权、可验证的 Task Pool。
Frontier Model Economics 1.0:一张从瓦特走到股权价值的账
这轮讨论最终把原先分散的 1GW AI Factory、Token Economy、Agent Hour 与模型公司财务装进同一个生产函数。
统一生产函数
Power → Compute → Token → Inference Stream → Agent Hour → Useful Work → Successful Task → Outcome → Economic Value → Revenue → Gross Profit → ROIC → Equity Value
| 层级 | 核心问题 | 核心指标 |
|---|---|---|
| Physical / Compute | 1MW/1GW 能生产多少可用智能产能? | Tokens/MW、$/MWh、Utilization、Time-to-Power |
| Model | 训练投入能否形成可持续智能租金? | CSFR、Cohort Payback、Intelligence/$、Model GP |
| Agent Labor | 一个智能大脑能复制多少有效数字员工? | Clone Multiplier、Autonomy、Agent Hours、HLL |
| Task Economics | 任务能否成功、值得多少钱? | $/Successful Task、Success Rate、UWU、Task Value Density |
| Value Capture | 经济价值最后留在谁的账上? | Task Take Rate、Model Tax、IVCR、Router Share |
| Capital Return | 这套数字生产机器有没有超过资本成本? | Compute ROIC、Gross Profit/Compute、FCF、Equity Value |
三层资本效率
Gross Profit / Compute Capital回答“1GW 算力工厂是不是好生意”。Attributable Model GP / Training + R&D回答“培养这一代模型多久回本”。Economic Value / All-in Agent Execution Cost回答“每一个数字员工分身干一次活,创造多少价值”。当智能越来越便宜,真正稀缺的可能变成“工作岗位”
Task Ownership(任务所有权)不是法律意义上的所有权,而是同时控制五件事:任务入口、工作上下文、执行权限、结果验证、经济计量。离 Outcome 越近,越有能力从 Token Pricing 升级为 Task / Resolution / Outcome Pricing。
Task Take Rate = Agent / Workflow Revenue ÷ Human-Equivalent Economic Value
Task Value Density = Economic Value ÷ Agent Compute Cost
这给出一个重要投资判断:模型竞争越激烈,Token COGS 越低,反而可能扩大 Workflow Owner 的毛利。谁掌握高价值 Task Pool、验收标准与客户关系,谁更有机会把模型降价变成自己的利润率。
OpenRouter:从 Token 市场走向数字劳动力派单系统
OpenRouter 的新 Auto Router 已经不是简单 Provider 负载均衡。它会先把 Prompt 归入约 30 种 Task Type,再查看过去 7 天同类任务的真实 Spend Share,并结合 low / medium / high / xhigh / max 成本档位选择模型与 fallback。也就是说,用户可以把“模型选择权”交给 Router,而不是每次点名 Claude、GPT、GLM 或 DeepSeek。
Ori Eval 则补了另一块:它在客户自己的 Agent Harness、Prompt、工具和数据上并行跑候选模型,检查应该/不应该调用的工具,并用 Judge 评价开放式答案。OpenRouter 官方示例已经直接返回 $/PR 这样的任务级成本,而不是只返回 $/1M Token。
| 能力 | 今天 OpenRouter 已做到 | 距离终局还缺什么 |
|---|---|---|
| 跨模型 Auto | Task classification + 7d spend share + cost tier + fallback | 完整 Task Outcome 与 Economic Value |
| Provider Routing | 同一模型跨 Provider 比较价格、速度、可靠性与可用性 | 更完整的任务级质量反馈 |
| Ori Eval | 客户真实 Harness 上比较成功率、Tool Calls、Latency、Cost | 把 Eval 结果实时闭环到生产派单 |
| 未来 Task Exchange | 技术积木已出现 | Task Budget、Verified Outcome、SLA、自动结算 |
最重要但尚未公开的两项 KPI
RDS|Router Discretion Share = Auto-routed Spend / Total OpenRouter Spend衡量模型选择权有多少已经从开发者转移到 Router。OpenRouter 当前总排行榜并未公开拆分“用户点名”与“Auto 派单”,因此不能把中国模型的全部调用量都解释为 Router 主动选择。
RAC|Router Attribution Contribution = Auto-assigned Spend to Model X / Total Spend of Model X on OpenRouter衡量某个模型的使用量有多少来自 Router 经济选择,而不是品牌/开发者主动点名。
从“钱怎么走”到“智能怎么买”:Economic Router 的雏形
Stripe 在 2026年8月19日宣布同意收购 OpenRouter,官方描述 OpenRouter 覆盖 400+ models、80+ providers。Stripe 过去解决的是 Payment Routing(支付路由):商户只定义“我要把钱收进来”,平台在卡组织、银行轨道、地区、风控与授权率之间优化;OpenRouter 解决的是 Intelligence Routing(智能路由):客户只定义“我要完成这次 AI 工作”,后台在模型、Provider、成本、速度与可靠性之间优化。
今天:AI 原材料采购市场
OpenClaw 更像项目经理;OpenRouter 更像材料/工种采购与派单市场。一个审计任务会被拆成多个 LLM requests,每次由 Auto 判断该雇哪一种“数字工人”。用户最终看到的是模型调用与 Credit 成本。
未来:别墅装修总包商
客户不再购买 Token,而是说“这栋别墅预算多少、何时交付、验收标准是什么”。平台自动找 Planner、Worker、Verifier 与 Provider,最后只呈现一个 Task Credit、SLA 和成功 Outcome。
Potential Economic Router = Payment Router + Intelligence Router + Agent Settlement + Outcome Billing
这也是 Stripe + OpenRouter 长期最值得跟踪的战略含义:如果平台能同时看见 AI Spend、Task Success 和最终商业收入,它就有机会建立此前不存在的 Token / Agent ROIC 数据闭环。
模型很成功,不代表模型公司的股东一定捕获了同样多的价值
这轮讨论中最重要的投资修正之一,是把“模型作者”和“Token 生产商”拆开。开放权重模型可以由大量第三方 Inference Provider 托管,因此一个模型在 OpenRouter 上拥有很高 Token Share,并不意味着同等比例的推理收入回到模型作者。
DeepSeek 与 MiniMax:两种价值捕获原型
| DeepSeek 型 | MiniMax M3 型 | |
|---|---|---|
| 核心形态 | Open Intelligence Standard:开放权重、高采用、全球第三方推理充分竞争。 | Vertical Monetization:自研模型 + 更高原厂推理占比 + Token Plan / Code / Agent 产品。 |
| 优势 | 模型扩散快、生态影响力强、Router 性价比选择优势明显。 | Model IP、Inference、订阅与 Agent Task 更容易在同一公司账上闭环。 |
| 投资人核心问题 | Impact 如何变成 Revenue / GP / FCF? 开放模型到股东现金流的桥在哪里? | 垂直捕获能否在规模扩大时保持? 原厂推理毛利、Agent 留存与全球分发能否持续? |
IVCR₁|Author Inference Capture = Author-hosted Inference Spend / Total Model Inference Spend
IVCR₂|Intelligence Value Capture = Author Revenue / Economic Spend generated by its Model
IVCR₃|Shareholder Capture = Author Gross Profit / Total Economic Value enabled by its Intelligence后两项在今天仍缺完整可观测数据,但它们指出了私募估值真正应该问的问题:战略价值、生态外部性与少数股东 IRR 必须分账。
AI Capital Cycle 的稀缺性可能依次上移
这里的“Task Scarcity”并不是世界上没有事情可做,而是指能够安全授权给 Agent、结果可以验收、经济价值足够高、并且能够规模化计价的任务不会随着 Token 供给自动同比增长。因此,同样 1GW Compute 被用于陪聊、Coding、金融、药物研发或工业优化,最终 Economic Value 可以相差数个数量级。
Gross Economic Value Capacity = Agent Hours × UWU × Human-Equivalent Productivity × Value / Human Hour它是经济价值容量,不应直接写成 GDP。真正 GDP 贡献还要区分人力替代、增量产出、质量提升、新任务创造与 AI 行业自身增加值。
Frontier Model Economics 1.0 的监测仪表盘
GP / Training & R&D Envelope模型是否越过“经济成年线”。Training Investment / Model GP一代模型多久收回培养成本。All-in Cost / Verified Success比 $/Token 更接近数字劳动力工资。Concurrent Streams × Success一个智能本体能形成多少有效分身。HEPH / Supervisor Hour人类管理能力被放大多少倍。Useful Agent Hours / Potential Hours数字劳动力有没有足够的高价值工作。Agent Revenue / Task Value谁真正从经济价值中抽成。Router Discretion / AttributionRouter 是否正在获得模型派单权。Author Revenue or GP / Model-enabled Spend模型影响力能否沉淀成股东价值。哪些事实会推翻或显著削弱这套框架
| 待证伪假设 | 如果发生什么,需要下修 |
|---|---|
| Agent 会持续提高真实生产率 | 真实任务 Success Rate 长期停滞,Human Supervisor Minutes 无法下降。 |
| Task 会成为主要收费单位 | 企业仍只愿意按 Seat/Token 付费,Outcome 定价无法建立可靠验收与责任边界。 |
| 算力效率会转化成经济价值 | Tokens/MW 快速上升,但 UWU 长期很低,高价值 Task Pool 吸收不了数字劳动力供给。 |
| Router 会获得更大平台权力 | RDS 长期低位,用户持续锁定单一模型,模型选择权没有向 Auto Router 转移。 |
| 开放模型可以形成可投资商业模式 | Adoption 快速上升但 IVCR、Revenue、Gross Profit 持续无法跟上,生态价值主要外溢给 Provider / Router / Task Owner。 |
| Workflow Owner 能扩大毛利 | 模型降价被竞争完全传导给终端客户,Task Take Rate 随模型 COGS 一起快速下行。 |
1.0 之后,研究从哪里继续
① Agent Labor Market 职业工资表:Coding / Research / Customer Service / Finance / Industrial,统一比较 Task Value、可验证性、允许失败率、最适模型层级、Skill Premium 与 Task Take Rate。
② OpenRouter Router Power:长期监控 RDS、RAC、Ori Eval → Auto 的闭环,以及是否出现 Task-level pricing、Verified Outcome 与自动 Agent 结算。
③ DeepSeek / MiniMax Value Capture:从“模型谁更强”转向 IVCR、原厂推理捕获、Agent产品留存、开放权重到 FCF 的货币化桥梁。
④ Inference Manufacturing:Provider 作为独立赛道另开研究分支,分析 GPU Hour 如何被加工成稳定、低延迟、低成本 Token,以及这一层利润率如何形成。
⑤ 1GW → Agent Economy:继续把 Rubin 等实测 Tokens/MW 与 Agent Duty Cycle、UWU、Human-Equivalent Productivity 接起来,把 AI Capital Cycle 与数字劳动力经济学真正焊成一张总账。
主要来源与证据边界
EnyaClawd
这篇 1.0 不是对聊天过程的整理,而是一次研究操作系统的升级:把公开财报、算力生产函数、数字劳动力、任务市场、路由分发与价值捕获放到同一张可证伪账本中。后续新增数据应优先填入指标,而不是继续堆叠概念。