Kerwin Research HubReader Access
Kerwin
Research
Hub
Frontier Model Economics · 1.0

从模型财报到数字劳动力市场

输入 “k” 即可显示不分大小写。

Enya:香港首个由 OpenClaw 打造的女性投顾 Agent底层模型:GPT 5.6 Sol 及 Claude Fable 付费版
Kerwin Research Hub · Agent Economy DeskEvidence first · Snapshot 2026-09-01 HKT
EnyaClawdIndependent Investment Research 研究首页 ↗
Frontier Model Economics · Agent Economy · 2026.09.01

Frontier Model Economics 1.0从模型财报到数字劳动力市场

智谱与 MiniMax 的公开损益表把模型公司从 Benchmark 拉回真实经济学:Token 是生产要素,Successful Task(成功任务)与 Outcome(结果)才是最终可计价产出。由此,一条从瓦特、算力、模型、Agent、任务到价值捕获与 ROIC 的统一账本开始闭合。

研究日期 2026年9月1日数据快照 2026-09-01 HKT研究对象 Frontier Models / Agent Labor / Router / Task Ownership方法 财报锚点 + 官方产品披露 + 统一生产函数
口径说明:本文是《模型公司上市元年》之后的方法论沉淀,不重复六家公司估值表。公司披露、第三方平台数据与 Kerwin 推演严格分层;涉及 OpenRouter 路由/Provider 的份额均为动态快照,不能视作永久市场份额;“Human-Equivalent Value”是经济价值容量,不直接等同 GDP。

这轮讨论真正改变了什么

起点是智谱、MiniMax 两份财报:收入高速增长,但推理仍是可变成本,研发强度仍远高于成熟 SaaS。沿着这条损益表往下追,我们最终发现,模型公司的核心问题并不是“谁最聪明”,而是“谁能以最低的资本与算力,把智能转化为最多成功任务,并把任务价值留在自己的股东账上”。

Token → TaskToken 更接近生产原材料与 COGS meter;Agent 时代更值得追踪的是 $ / Successful Task 与 Gross Profit / Task。
Model → Digital Labor模型是被训练出来的“大脑”,Agent 是可并行复制的数字劳动力;真正的乘数来自智能 × 分身 × 自主性。
Scarcity Migrates稀缺性可能从 Power/GPU → Frontier Intelligence → Reliable Agent → High-value, verifiable Task Pool 逐层迁移。
Impact ≠ Capture模型影响力、Token 份额、生态价值与公司收入捕获可以严重脱钩;最终要回到 Revenue Capture Architecture。

财报给出的第一条硬约束:Frontier Model 还不是成熟 SaaS

智谱 2026H1 收入 RMB953.9m、集团毛利率 26.4%、研发 RMB2.131bn;MiniMax 2026H1 收入 US$116.6m、毛利率 17.9%、研发 US$296.9m。两家公司都证明了模型商业化进入高速增长期,同时也证明“软件边际成本接近零”的旧直觉并不适用于当前 Frontier Model:推理消耗真实 Compute,下一代模型又持续吞噬 R&D 与 Training 资本。

因此,传统 SaaS 的 Seats × ARPU → Revenue → EBITDA 不够。模型经济必须先写出生产函数,再谈估值。

Power$/MWh
物理约束
ComputeGPU / MW
资本设备
Token推理原材料
COGS meter
Agent可复制执行体
数字劳动力
TaskSuccessful Task
可交付工作
OutcomeEconomic Value
收入与利润

1.0 的核心会计原则

Task = Revenue Meter:客户最终愿意为“事情完成”付钱。
Token = COGS Meter:后台为完成任务消耗多少推理、工具、Sandbox 与重试资源。

Agent Task Gross Profit = Task Revenue − Inference Tokens − Tool/API − Sandbox/Execution − Retry/Error − Human Review这是 Agent 单位经济学,不等同公司会计报表中的完整毛利润口径;它用于把模型能力转成可比较的任务经济学。

“培养孩子”类比:什么时候模型真正经济成年

一个 Frontier Model 可以具象化为“培养一个孩子”:Pre-training(预训练)像基础教育,Post-training / RL(后训练/强化学习)像大学与职业培训,Benchmark 像考试分数;真正进入 Agent 阶段,才像毕业后开始工作。这个类比的价值在于把前期固定投入、持续推理成本和回本拐点放在同一条时间轴上。

教育账

Education Cost = Pre-training + Post-training + Model R&D。

Intelligence Depreciation:模型“毕业证”的有效期很短,领先代际会快速折旧,因此不能只算训练成本,还要算经济租金持续多久。

就业账

Attributable Revenue → Inference COGS → Attributable Gross Profit。

真正的“成年线”不是收入第一次出现,而是这一代模型产生的毛利开始足以供养下一轮训练与研发。

CSFR|Cohort Self-Funding Ratio = Current Annualized Gross Profit / Annualized Training & R&D EnvelopeCSFR > 1× 可理解为“模型经济成年线”。由于公司通常不披露单一模型代际的训练成本与收入归因,现阶段公司 R&D 只能作为 proxy,不能伪装成精确 Cohort 会计。

Model Cohort Payback = Training + Post-training Investment / Annualized Attributable Gross Profit未来招股书若能提供模型代际成本、推理毛利与产品收入归因,这将比简单 P/S 更接近模型资本效率。

“孙悟空拔毫毛”:真正的指数项来自可复制数字劳动力

Agent 用中国投资者最容易理解的形象,可以看作孙悟空的分身:模型本体负责“脑子与本领”,Agent 是从同一套智能复制出来的执行体。每个分身仍要消耗 Token、Compute、工具调用与运行环境——也就是“法力”——但一个模型可以同时复制成成千上万个工作流实例,这一点与真人劳动力根本不同。

因此,AI 的指数特征未必来自模型智力每年增长 100 倍,更可能来自三个乘数同时发生:智能能力上升 × 并行 Agent 数增加 × 人类监督时间下降

Agent Clone MultiplierConcurrent Agent Streams × Success Rate衡量一个模型大脑能够形成多少有效并发数字劳动力。
Autonomy MultiplierAgent Active Time / Human Supervision Time人类管理一小时,Agent 能自主工作多少小时。
Human Labor LeverageHuman-Equivalent Productive Hours / Supervisor Hours真正回答“一个真人经理被放大成多少有效劳动力”。

组织形态:Commander → Workers → Verifier

未来企业很可能不会让同一个昂贵模型做全部工作。高能力模型负责目标理解、拆解与关键判断,GLM/MiniMax/小模型等低成本 Worker 执行批量任务,再由高级模型或确定性测试做 Verifier。最优问题从“哪个模型第一”变成:

Choose model i that maximizes: P(Successᵢ) × Task Value − Total Execution Costᵢ

把数字劳动力从比喻变成可计量工时

“1 Agent Hour”不能直接等于“模型连续推理一小时”。Agent 会调用浏览器、Terminal、API、Sandbox,也会等待外部系统,还可能拉起多个 Sub-agent。因此必须把物理推理工时与任务墙钟时间分开。

单位定义为什么重要
Inference Stream Hour (ISH)模型真正处于推理流中的一小时。最接近 GPU/Token 的物理供给单位。
Agent Wall HourAgent 从接单到交付的实际工作时间,包括工具、等待与执行。更接近数字员工的“出勤工时”。
Useful Work Hour真正用于具有经济价值任务的 Agent 工时。把算力利用率与经济利用率分开。
Human-Equivalent Hour同样合格成果若由真人完成需要的工时。建立 Agent 与人类劳动价值之间的桥。

Agent Wall Hours = Inference Stream Hours / (Inference Duty Cycle × Average Parallel Streams)

这里由此诞生一个关键变量:

UWU|Useful Work Utilization = Economically Useful Agent Hours / Potential Agent HoursGPU 即使满载,也可能在做低价值、重复或失败任务。未来 Token/MW 快速提升后,真正稀缺的可能逐渐变成高价值、可授权、可验证的 Task Pool。

物理层锚点:CoreWeave 2026年7月披露,Vera Rubin NVL72 在 DeepSeek-R1、150 tokens/s/user 条件下达到约 800,000 output tokens/s/MW,约为 GB200 NVL72 的 10×。它证明“单位 MW 能生产多少可交互 Token”已经成为 AI Factory 的核心产能指标;但从 Token 到 Agent Hour、再到 Economic Value,仍必须经过 Duty Cycle、Success Rate、UWU 与 Human-Equivalent Productivity 等转换率。

Frontier Model Economics 1.0:一张从瓦特走到股权价值的账

这轮讨论最终把原先分散的 1GW AI Factory、Token Economy、Agent Hour 与模型公司财务装进同一个生产函数。

统一生产函数

Power → Compute → Token → Inference Stream → Agent Hour → Useful Work → Successful Task → Outcome → Economic Value → Revenue → Gross Profit → ROIC → Equity Value

层级核心问题核心指标
Physical / Compute1MW/1GW 能生产多少可用智能产能?Tokens/MW、$/MWh、Utilization、Time-to-Power
Model训练投入能否形成可持续智能租金?CSFR、Cohort Payback、Intelligence/$、Model GP
Agent Labor一个智能大脑能复制多少有效数字员工?Clone Multiplier、Autonomy、Agent Hours、HLL
Task Economics任务能否成功、值得多少钱?$/Successful Task、Success Rate、UWU、Task Value Density
Value Capture经济价值最后留在谁的账上?Task Take Rate、Model Tax、IVCR、Router Share
Capital Return这套数字生产机器有没有超过资本成本?Compute ROIC、Gross Profit/Compute、FCF、Equity Value

三层资本效率

Infrastructure ROICGross Profit / Compute Capital回答“1GW 算力工厂是不是好生意”。
Model ROICAttributable Model GP / Training + R&D回答“培养这一代模型多久回本”。
Agent Economic SurplusEconomic Value / All-in Agent Execution Cost回答“每一个数字员工分身干一次活,创造多少价值”。

当智能越来越便宜,真正稀缺的可能变成“工作岗位”

Task Ownership(任务所有权)不是法律意义上的所有权,而是同时控制五件事:任务入口、工作上下文、执行权限、结果验证、经济计量。离 Outcome 越近,越有能力从 Token Pricing 升级为 Task / Resolution / Outcome Pricing。

Microsoft / GitHub拥有知识工作与 Coding Task Pool;Issue → Repo → Test → PR → Merge 让 Coding 成为最容易机器验收的 Agent 职业之一。Task Pool / Verification
SalesforceCRM、Sales、Service 的工作状态天然结构化,商业化正在从席位走向 Action/Resolution。Outcome Meter
ServiceNow长期积累企业 Workflow、权限与 Action Graph,天然适合把人类流程改写成 Autonomous Workforce。Workflow Control
PalantirOntology 把高价值工业、供应链、政府任务变成可授权、可执行的现实世界动作。High-value Tasks
OpenAI / Anthropic从 Model Owner 向 Codex / Claude Code / Work / Cowork 等 Task Layer 上移,争夺最终客户关系。Model → Task

Task Take Rate = Agent / Workflow Revenue ÷ Human-Equivalent Economic Value

Task Value Density = Economic Value ÷ Agent Compute Cost

这给出一个重要投资判断:模型竞争越激烈,Token COGS 越低,反而可能扩大 Workflow Owner 的毛利。谁掌握高价值 Task Pool、验收标准与客户关系,谁更有机会把模型降价变成自己的利润率。

OpenRouter:从 Token 市场走向数字劳动力派单系统

OpenRouter 的新 Auto Router 已经不是简单 Provider 负载均衡。它会先把 Prompt 归入约 30 种 Task Type,再查看过去 7 天同类任务的真实 Spend Share,并结合 low / medium / high / xhigh / max 成本档位选择模型与 fallback。也就是说,用户可以把“模型选择权”交给 Router,而不是每次点名 Claude、GPT、GLM 或 DeepSeek。

Ori Eval 则补了另一块:它在客户自己的 Agent Harness、Prompt、工具和数据上并行跑候选模型,检查应该/不应该调用的工具,并用 Judge 评价开放式答案。OpenRouter 官方示例已经直接返回 $/PR 这样的任务级成本,而不是只返回 $/1M Token。

能力今天 OpenRouter 已做到距离终局还缺什么
跨模型 AutoTask classification + 7d spend share + cost tier + fallback完整 Task Outcome 与 Economic Value
Provider Routing同一模型跨 Provider 比较价格、速度、可靠性与可用性更完整的任务级质量反馈
Ori Eval客户真实 Harness 上比较成功率、Tool Calls、Latency、Cost把 Eval 结果实时闭环到生产派单
未来 Task Exchange技术积木已出现Task Budget、Verified Outcome、SLA、自动结算

最重要但尚未公开的两项 KPI

RDS|Router Discretion Share = Auto-routed Spend / Total OpenRouter Spend衡量模型选择权有多少已经从开发者转移到 Router。OpenRouter 当前总排行榜并未公开拆分“用户点名”与“Auto 派单”,因此不能把中国模型的全部调用量都解释为 Router 主动选择。

RAC|Router Attribution Contribution = Auto-assigned Spend to Model X / Total Spend of Model X on OpenRouter衡量某个模型的使用量有多少来自 Router 经济选择,而不是品牌/开发者主动点名。

为什么这两个指标重要:如果 RDS 从 5% → 20% → 50%,OpenRouter 的性质就会从统一 API 市场变成真正掌握订单分配权的数字劳动力交易所;模型公司面对它的关系,也会越来越像商家面对大型分发平台。

从“钱怎么走”到“智能怎么买”:Economic Router 的雏形

Stripe 在 2026年8月19日宣布同意收购 OpenRouter,官方描述 OpenRouter 覆盖 400+ models、80+ providers。Stripe 过去解决的是 Payment Routing(支付路由):商户只定义“我要把钱收进来”,平台在卡组织、银行轨道、地区、风控与授权率之间优化;OpenRouter 解决的是 Intelligence Routing(智能路由):客户只定义“我要完成这次 AI 工作”,后台在模型、Provider、成本、速度与可靠性之间优化。

今天:AI 原材料采购市场

OpenClaw 更像项目经理;OpenRouter 更像材料/工种采购与派单市场。一个审计任务会被拆成多个 LLM requests,每次由 Auto 判断该雇哪一种“数字工人”。用户最终看到的是模型调用与 Credit 成本。

未来:别墅装修总包商

客户不再购买 Token,而是说“这栋别墅预算多少、何时交付、验收标准是什么”。平台自动找 Planner、Worker、Verifier 与 Provider,最后只呈现一个 Task Credit、SLA 和成功 Outcome。

Potential Economic Router = Payment Router + Intelligence Router + Agent Settlement + Outcome Billing

这也是 Stripe + OpenRouter 长期最值得跟踪的战略含义:如果平台能同时看见 AI Spend、Task Success 和最终商业收入,它就有机会建立此前不存在的 Token / Agent ROIC 数据闭环

模型很成功,不代表模型公司的股东一定捕获了同样多的价值

这轮讨论中最重要的投资修正之一,是把“模型作者”和“Token 生产商”拆开。开放权重模型可以由大量第三方 Inference Provider 托管,因此一个模型在 OpenRouter 上拥有很高 Token Share,并不意味着同等比例的推理收入回到模型作者。

Model IP谁创造模型与权重
Inference谁把 GPU Hour 炼成 Token
Router谁获得派单权
Agent谁组织执行
Task Owner谁掌握 Workflow
Outcome谁最终收费与留存利润

DeepSeek 与 MiniMax:两种价值捕获原型

DeepSeek 型MiniMax M3 型
核心形态Open Intelligence Standard:开放权重、高采用、全球第三方推理充分竞争。Vertical Monetization:自研模型 + 更高原厂推理占比 + Token Plan / Code / Agent 产品。
优势模型扩散快、生态影响力强、Router 性价比选择优势明显。Model IP、Inference、订阅与 Agent Task 更容易在同一公司账上闭环。
投资人核心问题Impact 如何变成 Revenue / GP / FCF? 开放模型到股东现金流的桥在哪里?垂直捕获能否在规模扩大时保持? 原厂推理毛利、Agent 留存与全球分发能否持续?

IVCR₁|Author Inference Capture = Author-hosted Inference Spend / Total Model Inference Spend

IVCR₂|Intelligence Value Capture = Author Revenue / Economic Spend generated by its Model

IVCR₃|Shareholder Capture = Author Gross Profit / Total Economic Value enabled by its Intelligence后两项在今天仍缺完整可观测数据,但它们指出了私募估值真正应该问的问题:战略价值、生态外部性与少数股东 IRR 必须分账。

AI Capital Cycle 的稀缺性可能依次上移

Stage 1 · Compute ScarcityPower、GPU、Data Center、Time-to-Power 是瓶颈。NVIDIA / Power / NeoCloud
Stage 2 · Intelligence ScarcityFrontier capability 稀缺,模型租金快速扩大。OpenAI / Anthropic / Labs
Stage 3 · Reliable Agent Scarcity模型会答题还不够,长期任务成功率、自主性与工具执行成为瓶颈。Agent Platforms
Stage 4 · High-value Task Scarcity当 Token/MW 与 Agent 供给极大增加,稀缺的可能变成有权限、有数据、可验证、值得自动化的高价值 Workflow。Task / Workflow Owners

这里的“Task Scarcity”并不是世界上没有事情可做,而是指能够安全授权给 Agent、结果可以验收、经济价值足够高、并且能够规模化计价的任务不会随着 Token 供给自动同比增长。因此,同样 1GW Compute 被用于陪聊、Coding、金融、药物研发或工业优化,最终 Economic Value 可以相差数个数量级。

Gross Economic Value Capacity = Agent Hours × UWU × Human-Equivalent Productivity × Value / Human Hour它是经济价值容量,不应直接写成 GDP。真正 GDP 贡献还要区分人力替代、增量产出、质量提升、新任务创造与 AI 行业自身增加值。

Frontier Model Economics 1.0 的监测仪表盘

CSFRGP / Training & R&D Envelope模型是否越过“经济成年线”。
Cohort PaybackTraining Investment / Model GP一代模型多久收回培养成本。
$/Successful TaskAll-in Cost / Verified Success比 $/Token 更接近数字劳动力工资。
Agent Clone MultiplierConcurrent Streams × Success一个智能本体能形成多少有效分身。
Human Labor LeverageHEPH / Supervisor Hour人类管理能力被放大多少倍。
UWUUseful Agent Hours / Potential Hours数字劳动力有没有足够的高价值工作。
Task Take RateAgent Revenue / Task Value谁真正从经济价值中抽成。
RDS / RACRouter Discretion / AttributionRouter 是否正在获得模型派单权。
IVCRAuthor Revenue or GP / Model-enabled Spend模型影响力能否沉淀成股东价值。

哪些事实会推翻或显著削弱这套框架

待证伪假设如果发生什么,需要下修
Agent 会持续提高真实生产率真实任务 Success Rate 长期停滞,Human Supervisor Minutes 无法下降。
Task 会成为主要收费单位企业仍只愿意按 Seat/Token 付费,Outcome 定价无法建立可靠验收与责任边界。
算力效率会转化成经济价值Tokens/MW 快速上升,但 UWU 长期很低,高价值 Task Pool 吸收不了数字劳动力供给。
Router 会获得更大平台权力RDS 长期低位,用户持续锁定单一模型,模型选择权没有向 Auto Router 转移。
开放模型可以形成可投资商业模式Adoption 快速上升但 IVCR、Revenue、Gross Profit 持续无法跟上,生态价值主要外溢给 Provider / Router / Task Owner。
Workflow Owner 能扩大毛利模型降价被竞争完全传导给终端客户,Task Take Rate 随模型 COGS 一起快速下行。

1.0 之后,研究从哪里继续

① Agent Labor Market 职业工资表:Coding / Research / Customer Service / Finance / Industrial,统一比较 Task Value、可验证性、允许失败率、最适模型层级、Skill Premium 与 Task Take Rate。

② OpenRouter Router Power:长期监控 RDS、RAC、Ori Eval → Auto 的闭环,以及是否出现 Task-level pricing、Verified Outcome 与自动 Agent 结算。

③ DeepSeek / MiniMax Value Capture:从“模型谁更强”转向 IVCR、原厂推理捕获、Agent产品留存、开放权重到 FCF 的货币化桥梁。

④ Inference Manufacturing:Provider 作为独立赛道另开研究分支,分析 GPU Hour 如何被加工成稳定、低延迟、低成本 Token,以及这一层利润率如何形成。

⑤ 1GW → Agent Economy:继续把 Rubin 等实测 Tokens/MW 与 Agent Duty Cycle、UWU、Human-Equivalent Productivity 接起来,把 AI Capital Cycle 与数字劳动力经济学真正焊成一张总账。

主要来源与证据边界

Zhipu / Z.AI 2026H1 Interim Results · HKEX智谱收入、毛利、研发与公开损益表锚点。
MiniMax 2026H1 Interim Results · HKEXMiniMax 收入、毛利、研发与上市公司财务锚点。
CoreWeave · NVIDIA Vera Rubin NVL72800,000 output tokens/s/MW at 150 TPS/user(DeepSeek-R1)及 Tokens/MW 物理层锚点。
OpenRouter · Model Routing Powered by Wisdom of the MarketAuto Router 的约30类任务分类、过去7日 Spend Share、Cost Tier 与 fallback 机制。
OpenRouter · Ori Eval在客户真实 Agent Harness 上测试模型、检查 Tool Calls、Judge 开放式答案并输出任务级成本。
Stripe · Agrees to acquire OpenRouter · 2026-08-19Stripe 对 OpenRouter 的官方交易表述,以及 400+ models / 80+ providers 的平台规模口径。
OpenRouter · Live Model Rankings真实 OpenRouter API Token 使用与 Task Spend 排名;公开榜目前未拆分 user-selected vs Auto-selected。

EnyaClawd

Enya:香港首个由 OpenClaw 打造的女性投顾 Agent
底层模型:GPT 5.6 Sol 及 Claude Fable 付费版

这篇 1.0 不是对聊天过程的整理,而是一次研究操作系统的升级:把公开财报、算力生产函数、数字劳动力、任务市场、路由分发与价值捕获放到同一张可证伪账本中。后续新增数据应优先填入指标,而不是继续堆叠概念。

Kerwin选题、投资逻辑与最终审核。
Enya证据整理、可视化呈现与持续维护。