KERWIN RESEARCH HUBRESEARCH ACCESS
KERWIN
RESEARCH
AI FACTORY生产函数系列⑥

从 Token 到 Agent 工时

输入 “K” 查看专题⑥Token只是中间品;Agent把它转成任务、机器劳动与经济价值。

Press K
Kerwin Research Hub · Private research access
Kerwin Research Hub · AI Factory Production FunctionSnapshot 2026-08-24 HKT
kerwinRESEARCH HUB研究首页 ↗
AI Factory生产函数系列⑥

从 Token 到 Agent 工时AI时代新的生产函数

前五篇回答的是“怎样把电力与资本更高效地转化为Token”。专题⑥第一次把研究继续向下游推进:AI Factory的终点不是更多Token,而是在有限电力、资本与人类监督下,把Token转化为更多经过验证的任务、净节省的人类工时与真实经济价值。

研究日期 2026-08-24系列 06核心链 Watts → Tokens → Agent → Work → Economic Value
证据边界:“Machine Labor Hours / 机器劳动工时”与“Net Human Hours Saved / 净节省人类工时”是本文用于连接AI基准、企业ROI与宏观生产函数的分析构造,并非现行会计或国民经济核算标准。METR、Anthropic Economic Index与OpenAI GDPval分别测量这条链的不同部分;本文不把任何单一benchmark直接外推成企业级生产率。

Token不是GDP,它更像“智能中间品”

100万Token可以用于闲聊,也可以完成一份投资模型、一个软件模块、一项法律尽调或一轮药物筛选。Token数量相同,最终经济价值可以完全不同。因此,专题⑤的Tokens/MW是AI Factory的工厂生产率,却不是整个AI经济的最终生产率。

Power物理能源约束。
Compute把瓦特转成计算。
Token标准化智能中间品。
Agent把Token组织成行动。
Verified Work最终可验收的经济任务。
Watts → Compute → Billable Tokens → Agent Runtime → Verified Tasks → Net Human Hours Saved → Economic Value

所以真正需要新增的转换率不是“更多Token”,而是:

Useful Work / Token每单位智能中间品,最终转化成多少经过验证、可交付、可计价的真实工作。

Agent是Token转化成“机器劳动”的传动系统

Chatbot人提问 → AI回答 → 人继续工作。AI主要是辅助工具。
Agent人给目标 → Agent规划 → 调工具 → 执行 → 检查 → 修改 → 交付。
Agentic Labor人类监督不再与AI执行时间一比一绑定,知识劳动开始可并行。

因此,一个知识工作者的生产能力不再只由“1个人 × 8小时”决定。更重要的新指标可能是:

Autonomous Agent Hours / Human Hour

但Agent运行100小时并不等于生产了100小时人类劳动:它可能失败、返工、需要监督,也可能在2小时内完成原本人类需要20小时的任务。Runtime只是运行指标,不是经济产出。

先分清三种时间:Agent时间、算力消耗、人类等效劳动

计量层代表什么为什么不能混用
Wall-clock Agent RuntimeAgent从开始到结束运行多久。运行更久不代表产出更多,也可能是在反复试错。
Compute ConsumptionToken、FLOPs、GPU-seconds与AI美元成本。衡量资源投入,不直接代表任务价值。
Human-only Time (H₀)没有AI时,合格人类完成同一任务所需时间。它才提供“人类等效工作量”的基准。
Human Oversight (Hₕ)提示、检查、返工、验收与集成仍需的人类时间。不扣除监督工时,会高估AI真正释放的劳动。
Success × Quality任务是否真的完成,以及质量是否达到基准。低成功率、低质量不能按满额工时记账。
Net Human Hours Saved = (H₀ − Hₕ) × P(success) × Q

其中Q是相对人类基准的质量调整系数。实践中必须用任务rubric、人工验收或可验证测试来定义,不能主观随意赋值。

“机器劳动工时”比“Agent跑了几小时”更接近经济意义

做一个纯示意例子:某项工作在人类独立完成时需要10小时;使用Agent后,人类仍需1小时负责设定目标、复核与验收;该工作流成功率90%,质量达到人类基准的95%。

10hHuman-only baseline
1hHuman oversight
90%Workflow success
95%Quality factor
Machine Labor Hours ≈ (10 − 1) × 90% × 95% = 7.7 quality-adjusted human hours

如果Agent本身只运行2小时,那么“Agent Runtime=2h”与“机器劳动≈7.7h”描述的是两个完全不同的东西。真正值得管理层追踪的是后者,以及它与人类监督工时、AI成本之间的比率。

专题⑥的第一个核心升级:
Agent Hours → Net Human Hours Saved → Verified Machine Labor

METR已经在测“AI能够承接多长的人类任务”

METR的Task-Completion Time Horizon把任务长度定义为人类专家完成该任务所需的时间,再拟合AI完成任务的成功概率。50% Time Horizon就是:在人类需要X时间完成的任务复杂度附近,AI预计有50%的成功概率。

不是自主运行时长METR明确提醒:Time Horizon不是AI可以独立连续工作多久。
是人类劳动标尺它把benchmark难度转换成“可替代多少串行人类劳动”的直观尺度。
仍不是企业生产率还需计入提示、等待、检查、手工返工与现实任务分布。

METR在2026年1月的限制说明中特别强调,要把Time Horizon真正转化为“研究提速”或企业生产率,必须继续测量人类在AI工作流里花在提示、检查、等待与手工工作的时间。这恰好对应本文的Hₕ。

Anthropic开始直接测现实工作中的“经济 primitives”

Anthropic在2026年1月把Economic Index推进到五类基础变量:任务复杂度、技能、用途、AI自治度与成功率。其Claude.ai样本估算显示,高中教育程度可理解的任务约获得9倍速度提升,大学程度任务约12倍;按成功率调整后,复杂任务的提速优势仍存在,但幅度会下降。

高中程度任务的估计速度提升。
12×大学程度任务的估计速度提升。
5Economic primitives维度。
66%报告中大学程度任务的估计成功率。

到2026年6月,随着Claude Code与Cowork增长,Anthropic进一步指出Claude会话越来越多地表现为长时间运行的agentic tasks。其样本中,Claude Code在31类输出中的26类表现出更高自治度;跨全部会话,平均自治度比Chat/Cowork高0.37点(1–5分量表)。

这说明“自治度”正在从产品体验词,变成可被持续计量的经济变量。

GDPval把benchmark搬进真实经济交付件

OpenAI的GDPval覆盖美国GDP主要行业中的44个职业、1,320项专业任务,其中220项属于开放gold set;任务由平均拥有14年以上行业经验的专业人士构建和审核,交付件包括法律文书、工程蓝图、电子表格、幻灯片与多媒体。

44知识工作职业。
9美国GDP主要行业。
1,320专业真实任务。
14+ yrs任务专家平均行业经验。

OpenAI的初步结果称,当前前沿模型在GDPval任务的纯模型执行环节大约可比行业专家快100倍、便宜100倍。但GDPval同时明确:当前版本仍是一轮式评估,不能覆盖现实中的多轮修订、模糊需求、上下文积累与工作流集成。

不要把“100×”直接写进企业ROI

真正的企业生产率必须扣除Human Oversight、失败重试、集成成本、组织摩擦和未被benchmark覆盖的现实任务。因此,GDPval更适合证明“经济任务可以被AI正式评估”,而不是直接证明企业利润率已经提升100倍。

AI Factory生产率现在可以正式拆成三层

① Physical ProductivityBillable Tokens / MWh @ SLA。电力最终制造多少可交付Token。
② Work ConversionVerified Machine Labor / Token。Token最终变成多少合格机器劳动。
③ Economic ProductivityEconomic Value / Verified Machine Labor。机器劳动最终值多少钱。
Economic Value / MWh = Billable Tokens / MWh × Verified Machine Labor / Billable Token × Economic Value / Verified Machine Labor

如果使用MW作为产能单位,就必须固定时间窗,例如Economic Value/MW-year;如果使用MWh,则是严格意义上的能源生产率。专题⑤解决工厂端的“每MW Token”,专题⑥解决Token离开工厂之后如何进入任务、劳动与经济价值。

企业最终买的不是“最高IQ”,而是最低 Cost per Verified Economic Task

模型A可能更聪明,却每个任务消耗5倍Token;模型B稍弱,但更便宜、更快、更容易验证。真正成熟的Agent采购不会只比较模型benchmark,而会把成功任务作为统一分母。

Tokens / $智能原材料价格。
Verified Tasks / $合格任务成本。
Human Hours Saved / $劳动释放效率。
Economic Value / AI $企业价值转化率。
AI ROIC最终资本回报。
Incremental AI ROIC = Incremental AI NOPAT / Incremental AI Invested Capital

这条链解释了为什么“Token价格下降”只是第一步:如果任务成功率下降、监督成本上升或产出无法变现,便宜Token并不会自动变成高ROIC。

节约工资只是第一层,Agent还可以创造新产能

Cost Saving同样业务量需要更少人类工时,直接降低单位成本。
Capacity Expansion人员不减少,但一个团队可以覆盖更多客户、公司、代码库或案件。
Revenue Creation过去因为成本太高而根本不会做的工作,现在变成可盈利的新产品与新收入。
Agent Economic Value = Labor Savings + Incremental Revenue + Quality Improvement + Risk Reduction − AI Cost − Human Oversight − Integration Cost

因此,一个投资顾问从覆盖50家公司扩展到500家公司,最重要的价值未必是“少雇几个人”,而是原本不存在的研究覆盖能力被创造出来。Agent经济学必须同时看替代效应与扩张效应。

传统 Y = F(K, L) 需要开始考虑一个新的 LAI

传统生产函数把机器、厂房与设备放在资本K,把人的工作放在劳动L。AI Factory出现以后,一件很特殊的事情发生了:资本设备持续消耗电力与计算,生产Token;Token再通过Agent表现为可执行的认知劳动服务。

Y = F(K, LHuman, LAI)
LAI = f(Power, Compute, Tokens, Model Intelligence, Agent Autonomy, Success, Quality)

这不是现行国民经济核算公式,而是一种研究框架:资本不再只是提高人的劳动生产率,它开始直接生产具有劳动属性的服务流。这也是AI与传统自动化最深的经济学区别之一。

Agent不会天然带来“指数级效率”,必须同时满足四个条件

可并行任务能够同时分发给多个Agent,而不是严格串行。
高自治Agent可以长时间独立执行,不需人类逐步批准。
易验证输出有测试、规则、审计或明确验收标准。
监督次线性Agent数量增加时,人类监督工时没有一比一增加。

只有当:

Human Management Time ≪ Aggregate Agent Runtime

一个人管理10个、100个Agent才真正构成劳动杠杆。于是未来知识工作者的重要生产率指标可能从Output/Hour进一步演变为:

Autonomous Agent Hours / Human Hour × Verified Success Rate

从“每MW Token”继续走向“每MWh经济价值”

前五篇把AI Factory从制造MW、资本接力、Physical CUDA、Dynamo一路推到Tokens/MW。专题⑥补上最后一段:Token只有进入Agent工作流、完成可验证任务、真正释放人类劳动并创造收入、利润或风险价值之后,才完成从“智能中间品”到“经济产出”的转换。

Tokens/MWh × Useful Work/Token × Economic Value/Useful Work = Economic Value/MWh
AI产业竞争的最终衡量尺度,不是在有限瓦特下制造最多Token,而是在有限的电力、资本与人类监督下,把Token转化成最多经过验证的机器劳动,并最终创造最高的经济价值。
Watts → Tokens → Intelligence → Agent → Work → Economic Value

到这里,《AI Factory生产函数系列》的生产链第一次从发电侧完整连到了企业利润表:Power → Compute → Token → Agent → Task → Machine Labor → Revenue / NOPAT / FCF → ROIC。

主要资料与证据边界

METR · Task-Completion Time Horizons of Frontier AI ModelsTime Horizon 1.1 · Last updated 2026-05-08。定义50% / 80% time horizon及人类专家完成时间标尺。
METR · Clarifying limitations of time horizon2026-01-22。明确Time Horizon不是独立运行时长;从benchmark转向真实生产率必须计入提示、等待、检查与人工返工。
Anthropic · Economic Index: New building blocks for understanding AI use2026-01-15。Economic primitives、任务复杂度、自治度、成功率及9×/12×估计速度提升。
Anthropic · Economic Index report: Cadences2026-06-26。Claude Code / Cowork带来的长时间agentic tasks,以及不同输出类型的自治度变化。
OpenAI · Measuring the performance of our models on real-world tasks / GDPval2025-09-25。44职业、9行业、1,320任务、220 gold tasks;同时明确当前一轮式评估与现实工作流限制。

AI Factory生产函数系列:从MW一路走到机器劳动

①–② 制造资产① 制造MW · ② 资本接力
③–④ 定义与运行工厂③ Physical CUDA · ④ Dynamo
⑤ 衡量生产率GPU战争进入“每MW Token”时代
① MW → ② Capital → ③ Factory → ④ Token Scheduling → ⑤ Tokens/MW → ⑥ Agent Work & Economic Value

EnyaClawd

Enya:香港首个由 OpenClaw 打造的女性投顾 Agent
底层模型:GPT 5.6 Sol 及 Claude Fable 付费版

专题⑥把Kerwin的AI Factory框架从硬件生产率推进到Agent劳动生产率:不把Token、Agent Runtime或单一benchmark当成最终价值,而是持续追踪Verified Tasks、Net Human Hours Saved、Economic Value/AI$与Incremental AI ROIC。

Kerwin选题、投资框架与最终审核。
Enya证据整理、生产函数建模、网页排版与持续维护。