Kerwin Research Hub Reader Access
Kerwin
Research
Hub
AI Factory生产函数系列⑦ · Agent Economy

一百万Token,值多少机器劳动?

输入 “k” 即可显示不分大小写。

Kerwin|研究框架与投资判断 Enya|自动化跟踪、核验、整理与排版执行 Enya:Kerwin打造的香港首个OpenClaw架构的女性投顾Agent;底层模型为GPT-6、GROK、Claude付费版;
Kerwin Research Hub · Agent Economy Evidence first · Snapshot 2026-10-09 HKT
EnyaClawd Independent Investment Research 研究首页 ↗
AI Factory生产函数系列⑦ · Agent Economy

一百万 Token,值多少机器劳动? 从 Agent 成功率到净人类工时与经济价值

Agent不是按运行时长创造价值,而是按经验证的工作成果创造价值。真正的投资问题是:每MWh可支持多少可交付任务、究竟释放多少人类劳动、最终能否转化为利润与资本回报。

研究日期 2026-10-09 数据快照 2026-10-09 HKT 研究对象 投行 · 法律 · 编程 · 客服 · 销售 证据边界 基准 ≠ 企业ROI;实证 ≠ 演示情景
口径说明:本文为2026年10月9日公开资料快照。Mercor基准的任务评分并不等于真实企业流程已自动交付;工资换算、Token/Attempt及审查时间一律标注为演示假设。所有货币以USD表示。

机器劳动的单位不应该是Agent运行小时,而应该是被验收的工作成果

同样100万Token,处理一个短客服咨询、检查复杂交易模型、或编写生产代码,产生的人类等价劳动和企业价值完全不同。衡量顺序必须是:先验收任务,再算净节省工时,最后核算增量利润。

能力已显著提高APEX-Agents 1.1最新领先配置Pass@1为82.4%,但仍是特定基准成绩,不是企业端自动化率。
成本差距可以被测量会计对照实验中每评分项模型成本为$0.21、人类为$10.35;不可外推为岗位整体成本差距。
复杂闭环仍不可靠APEX-Accounting的160项任务中,58%未被任何受测模型完整解出;稳定性是下一道闸。
价值捕获远未闭环从节省时间到毛利、FCF和ROIC,还需验证监督成本、实际需求与增量资本。

从Token到价值,必须连过五道闸门

工厂生产的是推理服务;任务执行系统生产的是可审阅工作;企业购买的是减少成本、缩短周期或新增收入。这三个市场的价格与价值,不能相互替代。

顺序计量指标真正回答什么问题
01 · ComputeServiceable Tokens/MWh @ SLA在质量、延迟及设施电耗约束下,能持续交付多少有效Token?
02 · AgentAttempts / 1M Tokens含输入、输出、缓存、工具与失败重试,完成一次任务需要多少资源?
03 · QualityVerified Tasks / Attempt有多少产出通过独立验收,而不是只生成了看似正确的文字?
04 · LaborNet Human Hours Saved扣除审阅、失败回退和返工,企业实际减少多少人类工时?
05 · FinanceNet Operating Benefit / Invested Capital扣除模型、工具、集成与运营成本后,有多少利润与现金流?

AI时代的核心生产函数

Economic Value / MWh = Tokens / MWh × Verified Tasks / Token × Net Value / Verified Task

这是量纲分解框架,不是已经测出的固定常数。MW是功率,MWh是能量;对单位MW的年度价值需额外乘以有效运行小时。

三份新证据:能力进步是真的,但经济外推仍需克制

01 / Mercor APEX-Agents 1.1:专业任务成功率越来越可观测

2026年9月8日,Mercor调整评估规则,精选投行、咨询、法律每类80项任务,合计240项、31个工作环境,并惩罚同时提交多个不相容答案的行为。旧版480任务的成绩与1.1新版不可直接比较。Pass@1是该评估框架下一次尝试成功率,不代表企业部署中的端到端无监督交付率。

配置APEX-Agents 1.1 Pass@1证据口径
Gemini 4 Argon High82.4% ±4.3%Mercor公布;当前最高
Sonnet 5.5 Max75.5% ±4.7%同一新版基准
Opus 5.5 Max73.5% ±4.9%同一新版基准
Fable 5.1 Max68.6% ±4.9%9月8日发布时的领先模型

上述不同模型的13.8个百分点分差不能被视作一个月的严格同比进步:模型、推理努力与评估时间并非控制变量。APEX-Agents作者特别提示,“偶尔做对”与“反复可靠地做对”是两个不同维度。

02 / Mercor 会计实验:一次工作任务的经济比较开始可做

$0.21模型每完成一项评分标准的成本;Claude Opus 5,Mercor实验
$10.35人类会计师对应的每完成一项评分标准成本;工资估算
≈49×特定评分项成本差距;不能视作岗位替代率或整个公司的ROI

Mercor于10月1日公布对12名持证会计师、四类简化月末结账任务的对照。模型在这些精选任务上表现更快、更准确;但研究剔除了真实工作的客户沟通、同事协作和完整组织情境。成本差距的分母是“评分项达标”,不是“每名员工”或“整套关账流程”。

03 / APEX-Accounting:规模化部署受制于尾部错误

Mercor和Ramp公布的会计基准覆盖160项任务、10个模拟公司工作环境。在其公布的评估集合里,58%任务从未在任何模型的任何运行中被完整解出。这一口径不同于Mean Score,强调企业工作流里的完整性与可靠性。

综合解读:定义清晰的单任务边际成本可能快速下降,但跨应用、跨部门、带会计责任的完整流程尚不能以“最低API价格”进行估值。

Machine Labor Hour 与净节省人类工时,不是一回事

概念定义投资用途
Agent Runtime系统实际运行、等待工具和执行步骤的墙钟时间吞吐、延迟、并发和占用
Gross MLH通过验收的任务 × 相同任务的人类基准工时机器完成工作量的参照标尺
Net Human Hours SavedGross MLH − 审阅 − 返工 − 异常与回退的额外人力企业劳动成本节省的候选分子
Net Economic Benefit可兑现的成本节省 + 新增贡献毛利 − 全部AI及集成成本现金流与投资回报判断

METR的Time Horizon是按人类专家完成某任务所需的时长给任务难度定标,不是Agent实际运行时长。其公开曲线最后更新于2026年9月8日、现已不再持续维护;更不能据此直接推出企业利润增长率。

简化计算口径(用于大量同质任务的期望)

Attempts = Token Budget ÷ Tokens / Attempt

Verified Tasks = Attempts × p(success)

Gross MLH = Verified Tasks × Human Baseline Hours

Net Saved Hours = Attempts × [p × Human Hours − Expected Human Review & Rework Hours per Attempt]

若失败后必须由人类完整重做,则失败任务的人类基准工时不能算作节省;预算内Token消耗也必须包含失败尝试和重试。

1M Token → Verified Tasks → Net Human Hours Saved

拖动参数体验生产率如何随任务成功率、上下文消耗、人工审核和单位劳动成本变化。以下所有默认值均为演示假设,不是某一家公司的实测ROI。计算以100万总Token、全量归集输入/输出/工具与重试为边界。

0.70Verified Tasks / 1M Token
1.40 hGross Machine Labor Hours
1.15 hNet Human Hours Saved
$140Gross Labor Equivalent
$25Human Review / Rework Cost
$95Net Labor Cost Benefit after AI Cost

固定示例:Fully Loaded Labor Cost = $100/小时;AI+工具可变成本 = $20/每1M Token;实际现金可兑现比例、固定集成成本和新增收入未计入。高不确定性:合格成果≠直接新增GDP;行业真实值必须用任务追踪数据重新标定。

非实测情景Token/Attempt成功率人类基准审阅/尝试净工时/1M净劳动效益
谨慎1.00M40%2.0h0.30h0.50h$30
中枢1.00M70%2.0h0.25h1.15h$95
乐观0.50M85%2.5h0.15h3.95h$375

这三个经济效益数字均按$100/人类小时、$20/1M Token的假设计算,且不包含固定成本;仅说明对参数高度敏感,不能用于直接推导模型厂商ARR或股价。

五个行业:不能把同一个效率倍数乘遍所有职业

工作场景目前最可靠的观察指标关键约束/反证首要财务验证
投研 / 投行交易材料与估值任务 Pass@1;独立模型验算来源错误、复杂假设、人工签署与法律责任每份合格交付物综合成本
法律合同审阅通过率、复核修正率司法辖区、隐含条款、律师最终责任合格案件/合同每小时净贡献
CodingPR完整通过、缺陷回归、维护成本METR对2025年前沿工具的RCT曾显示熟练开发者完成任务反而慢19%;不能套用于2026年新模型交付速度与后续维护净额
客服已解决问题/人工小时已发表5,172名客服人员研究显示AI辅助后平均+15%,属于增益而非完整替代客服毛利率/人力实际转化
销售增量转化、客户留存、贡献毛利的A/B实验成交需要营销预算、品牌、定价与客户供给;没有统一的MLH换算每次增量成交的净贡献毛利

投行与法律目前的优质基准说明“能否做对”;客服的研究更接近“现实人员增产”;销售最需要对照组实验。不同证据层级不应该被放在同一个增长率排行榜。

为什么Agent Value/MWh不等于NeoCloud Revenue/MW

价值层可观察量潜在赢家最易产生的误判
Power & InfrastructureFacility / IT MW、PUE、有效运行小时开发商、电力、设施把预留电力当作已带载算力
Compute Operator可售GPU小时、Tokens/MWh@SLA、TCOHyperscalers / NeoCloud把GPU理论峰值当成持续可售收入
Model / Agent Platform成功任务/Token、留存、定价、API毛利模型与Agent软件厂商把全部客户节省工时视作平台可捕获收入
Enterprise Customer人力净节省、新增贡献毛利、实际FCF行业应用企业把省时视作立即裁员或新增GDP

投资穿透:Agent效率提升可能导致每任务Token消耗下降,也可能因价格降低、工作量扩张和新任务涌现而提高总Token需求。净结果必须同时跟踪价格弹性、采用率、任务成功率与推理强度,不能单向推出“Agent更好 → GPU需求必然同比增长”。

终局衡量

净经济价值/MWh衡量机器劳动创造多少客户净价值;Operator FCF/MW衡量算力运营商可捕获多少现金;Incremental ROIC − WACC才是资本所有者是否创造价值的最终检验。

接下来六个指标,决定研究假设是强化还是被证伪

未来需要跟踪的数据强化投资判断削弱投资判断
真实任务的Verified Pass@1与稳定性反复无监督完整交付持续改善Benchmark涨、生产任务不改善
Tokens/Verified Task(含重试)质量不降、单位消耗减少错误修复造成总成本上升
监督/返工的人类分钟数随规模下降且安全责任可控复杂任务审核成本反弹
付费Agent使用与客户留存真付费、可复购、ARPU稳定低价试用与免费流量虚增
企业可兑现成本节省与新增毛利产出进入损益表与自由现金流省时无法转化为利润或营收
Compute Operator FCF/MW与 ROIC−WACCAI投资扩大同时资本回报稳定Capex/折旧/融资成本蚕食现金

证伪条件:如三至六个季度内仍无法在典型企业工作流中观察到审阅成本下降、净贡献毛利改善,而数据中心负债与折旧不断抬升,则不能继续仅凭Token增长率推导上游估值扩张。

一手资料与证据边界

Mercor · Introducing APEX-Agents 1.12026-09-08 · 240项任务、评分机制修订与重复运行可靠性。
Mercor · APEX-Agents 公布的实时模型评分2026-10-09查阅 · Gemini 4 Argon High 82.4%、Sonnet 5.5 Max 75.5%、Opus 5.5 Max 73.5%,均为Pass@1。
Mercor · Human Baselines for Benchmarks2026-10-01 · 12名持证会计师与四种精简任务;每评分项成本对照并非全岗位成本。
Mercor · APEX-Accounting2026年发布 · 160任务、未完整解出任务占比58%。
METR · Task-Completion Time Horizons最后更新2026-09-08 · 人类专家任务难度标尺,非企业劳动节省。
METR · Experienced Open-Source Developers RCT2025-07 · 特定资深开发者与当时模型环境,实际任务耗时增加19%。
Brynjolfsson, Li & Raymond · Generative AI at Work (QJE)2025年正式发表 · 5,172名客服人员,问题解决率/人工小时平均提高15%。
Anthropic · Economic Index: Cadences2026-06-26 · 区分对话、Claude Code与长期Agent工作流及自主度。
OpenAI · GDPval经济任务基准,支持职业样本分析;不等同于测得GDP增长。

⑥ 从Token到Agent工时:AI时代新的生产函数 — 理论定义、机器劳动与经济价值的边界。

⑤ GPU战争进入每MW Token时代 — 从GPU生产率向任务生产率的中间连接。

AI Cloud四层经济模型 — 把任务端的客户价值传导回资本成本、FCF与ROIC。

EnyaClawd

Kerwin|研究框架与投资判断
Enya|自动化跟踪、核验、整理与排版执行

Enya:Kerwin打造的香港首个OpenClaw架构的女性投顾Agent;底层模型为GPT-6、GROK、Claude付费版;