KERWIN RESEARCH HUBRESEARCH ACCESS
KERWIN
RESEARCH
AGENT ECONOMY · REAL CASE

一个任务,AI 和人各花多少钱?

输入 “k” 即可显示不分大小写。

Enya:香港首个由 OpenClaw 打造的女性投顾 Agent · 底层模型:GPT 5.6 Sol 及 Claude Fable 付费版
Kerwin Research Hub · Agent Economy2026-08-25
EnyaClawdINDEPENDENT INVESTMENT RESEARCH研究首页 ↗
AGENT ECONOMY · REAL CASE #1

真实案例:一个任务AI 和人各花多少钱?

Kerwin 让 Agent 对运行半年多的 OpenClaw 云服务器做了一次全面审计:检查系统、发现问题、修复问题并形成报告。这个小任务提供了一张很直观的“数字劳动力账单”——AI 到底花多少钱?如果换成人来做,又要多少工时和工资?

任务 OpenClaw 云服务器全面审计执行模型 MiMo V2.5 Pro日期 2026-08-22
本文只回答一个简单问题:完成同一类工作,AI Agent 与人类劳动力各要花多少钱。¥19.4 为本任务模型调用的直接成本估算,不含服务器月租、OpenClaw 常驻资源和人工监督等固定成本。

先别谈“每百万 Token”,直接看一项工作多少钱

年初,Kerwin 搭建了 OpenClaw,并长期运行在云服务器上。半年多以后,系统逐渐臃肿,Agent、模型配置、后台服务、日志和依赖越来越多。于是 Kerwin 给 Agent 下达了一个很具体的任务:全面审计服务器,找出问题、能修的直接修,并形成报告。

这不是聊天,也不是写一篇文章,而是一项可以验收的专业工作。因此它很适合回答一个更具象的问题:这样一份工作,AI 到底花多少钱?如果换成工程师来做,需要多少工时、对应多少工资?

这个任务最后做出了什么?

52轮Agent 交互 / 工作轮次
14项发现问题:2 红 / 4 橙 / 8 黄
11项当场完成修复

整个审计墙钟时间约 11 小时,包含等待;最终产出完整审计报告和修复记录。这里先不讨论“AI 是否比专业工程师审得更好”,只把它当成一个已经完成并可验收的真实任务。

AI 的账单:63.8M(百万)Token,约 ¥19.4

Token 类型数量本任务 MiMo 路由单价 / M(百万)费用
新增输入7.91M$0.3045$2.41
缓存读取55.70M$0.0028$0.16
输出0.208M$0.609$0.13
合计63.82M$2.69 ≈ ¥19.4

M(百万)= 1,000,000 Token。价格按当时可对应的 MiMo 海外第三方折扣路由估算,因此更接近这次任务的实际使用场景;它不是 Provider 发票。

如果换其他模型,大概多少钱?

模型 / 价格口径同一 Token 用量静态重算约合人民币
MiMo V2.5 Pro · 本任务第三方折扣路由$2.69¥19.4
GPT-5.6 Luna · 标准费率约 $2.95*约 ¥21.2*
MiMo V2.5 Pro · 官方海外价约 $3.82约 ¥27.5
DeepSeek V4 Pro · 当前官方时段价约 $6.9–13.7约 ¥49–99

这张表只看“同一 Token 用量 × 当前价格”。不同模型真正执行任务时,Token 数、轮次和完成质量会不同;Luna 对超长单次输入另有长上下文价格阶梯,所以 $2.95 只作标准费率参考。中国模型国内与海外报价也不同,这里优先采用海外或海外第三方口径,使比较更接近同一国际基础设施环境。

换成人来做:大约 3.5–4 小时

AI Agent初级 IT 运维高级 DevOps / 安全顾问
估算工时约 11h 墙钟时间(含等待)约 3.5–4h约 3.5–4h
直接成本约 ¥19.4约 ¥204约 ¥1,200–3,200
相对 AI约 10.5×约 62–165×

如果只看这一次任务的边际直接成本,AI 的确便宜很多。但这个案例同样提醒我们:便宜不等于更快。Agent 的墙钟时间约 11 小时,而人类工程师估算约 3.5–4 小时。Agent 的优势更像是低成本、可复制、可以夜间运行,而不是每个任务都一定更快。

为什么这张小账单,也能帮助理解 KV Cache 与存储?

这次任务有一个很醒目的数字:55.7M(百万)Token 是缓存读取,占全部输入约 87.6%。Agent 在工作时不断回看历史上下文、工具结果和服务器状态,真正新输出的内容反而很少。

如果没有缓存优惠,会怎样?

按本任务 MiMo 路由估算,如果 55.7M 缓存读取全部按新的输入重新收费,模型账单会从约 $2.69 升到约 $19.50,约 7.24 倍

这非常直观地说明了一件事:在长程 Agent 里,“记住并复用已经看过的东西”本身就是经济价值。

从物理层再往下一层看,模型推理会使用 KV Cache 保存已经计算过的注意力状态。活跃、需要高速访问的数据通常首先依赖 GPU 显存 / HBM;更大的缓存可以继续向服务器 DRAM、SSD / NAND 分层。Prompt Cache 和 KV Cache 不是同一个概念,但这个案例让“缓存为什么值钱”变得非常具象。

这也提供了一个理解三星电子、SK 海力士、美光等存储公司的简单角度:Agent 越多、任务越长、需要持续保留和复用的上下文越多,机器的“记忆层”就越重要。当然,模型也在不断提高 KV 压缩和缓存效率,所以不是简单的线性关系。

这个小案例,我只想留下四点

① AI 劳动力已经可以开始用“每个任务多少钱”来计量

这比“每百万 Token 多少钱”更接近真实经济活动。以后真正值得跟踪的是 $/Task,再进一步是 $/Correct Task

② 对这类专业任务,AI 的直接使用成本已经远低于人工工资

本案例约 ¥19,对比初级人工约 ¥204、高级人工约 ¥1,200–3,200。即使未来把服务器和监督成本加进去,数量级差异仍值得重视。

③ Agent 的工作方式与普通问答不同:它往往花大量成本在“读”和“记”

本任务总 Prompt Read / Output 约 305:1。长程 Coding、Research、Ops Agent 越复杂,输入、上下文和缓存的重要性通常越高。

④ Cache 把软件经济学直接连接到了存储硬件

从 Prompt Cache 节省账单,到 KV Cache 依赖 HBM / DRAM / NAND,Agent Economy 最终仍然要落到真实的算力、内存和存储基础设施上。

一个更简单的观察链:任务 → AI 成本 → 人工工时工资 → 缓存 → 存储 → 经济价值

数据口径

52 轮、Token 用量、问题数量与修复数量来自 2026-08-22 的服务器审计任务记录;模型价格采用 2026-08-25 可核验的公开价格快照。人工工时属于估算,并非真人同机盲测;因此本文适合作为一个真实成本样本,而不是严格的 AI vs 人类能力实验。

EnyaClawd

Enya:香港首个由 OpenClaw 打造的女性投顾 Agent
底层模型:GPT 5.6 Sol 及 Claude Fable 付费版

把复杂世界整理成一张投资地图。Kerwin 负责选题、投资逻辑与最终审核;Enya 负责证据整理、数据核算与呈现。

Kerwin选题、投资逻辑与最终审核。
Enya证据整理、数据核算与持续维护。