真实案例:一个任务AI 和人各花多少钱?
Kerwin 让 Agent 对运行半年多的 OpenClaw 云服务器做了一次全面审计:检查系统、发现问题、修复问题并形成报告。这个小任务提供了一张很直观的“数字劳动力账单”——AI 到底花多少钱?如果换成人来做,又要多少工时和工资?
先别谈“每百万 Token”,直接看一项工作多少钱
年初,Kerwin 搭建了 OpenClaw,并长期运行在云服务器上。半年多以后,系统逐渐臃肿,Agent、模型配置、后台服务、日志和依赖越来越多。于是 Kerwin 给 Agent 下达了一个很具体的任务:全面审计服务器,找出问题、能修的直接修,并形成报告。
这不是聊天,也不是写一篇文章,而是一项可以验收的专业工作。因此它很适合回答一个更具象的问题:这样一份工作,AI 到底花多少钱?如果换成工程师来做,需要多少工时、对应多少工资?
这个任务最后做出了什么?
整个审计墙钟时间约 11 小时,包含等待;最终产出完整审计报告和修复记录。这里先不讨论“AI 是否比专业工程师审得更好”,只把它当成一个已经完成并可验收的真实任务。
AI 的账单:63.8M(百万)Token,约 ¥19.4
| Token 类型 | 数量 | 本任务 MiMo 路由单价 / M(百万) | 费用 |
|---|---|---|---|
| 新增输入 | 7.91M | $0.3045 | $2.41 |
| 缓存读取 | 55.70M | $0.0028 | $0.16 |
| 输出 | 0.208M | $0.609 | $0.13 |
| 合计 | 63.82M | — | $2.69 ≈ ¥19.4 |
M(百万)= 1,000,000 Token。价格按当时可对应的 MiMo 海外第三方折扣路由估算,因此更接近这次任务的实际使用场景;它不是 Provider 发票。
如果换其他模型,大概多少钱?
| 模型 / 价格口径 | 同一 Token 用量静态重算 | 约合人民币 |
|---|---|---|
| MiMo V2.5 Pro · 本任务第三方折扣路由 | $2.69 | ¥19.4 |
| GPT-5.6 Luna · 标准费率 | 约 $2.95* | 约 ¥21.2* |
| MiMo V2.5 Pro · 官方海外价 | 约 $3.82 | 约 ¥27.5 |
| DeepSeek V4 Pro · 当前官方时段价 | 约 $6.9–13.7 | 约 ¥49–99 |
这张表只看“同一 Token 用量 × 当前价格”。不同模型真正执行任务时,Token 数、轮次和完成质量会不同;Luna 对超长单次输入另有长上下文价格阶梯,所以 $2.95 只作标准费率参考。中国模型国内与海外报价也不同,这里优先采用海外或海外第三方口径,使比较更接近同一国际基础设施环境。
换成人来做:大约 3.5–4 小时
| AI Agent | 初级 IT 运维 | 高级 DevOps / 安全顾问 | |
|---|---|---|---|
| 估算工时 | 约 11h 墙钟时间(含等待) | 约 3.5–4h | 约 3.5–4h |
| 直接成本 | 约 ¥19.4 | 约 ¥204 | 约 ¥1,200–3,200 |
| 相对 AI | 1× | 约 10.5× | 约 62–165× |
如果只看这一次任务的边际直接成本,AI 的确便宜很多。但这个案例同样提醒我们:便宜不等于更快。Agent 的墙钟时间约 11 小时,而人类工程师估算约 3.5–4 小时。Agent 的优势更像是低成本、可复制、可以夜间运行,而不是每个任务都一定更快。
为什么这张小账单,也能帮助理解 KV Cache 与存储?
这次任务有一个很醒目的数字:55.7M(百万)Token 是缓存读取,占全部输入约 87.6%。Agent 在工作时不断回看历史上下文、工具结果和服务器状态,真正新输出的内容反而很少。
如果没有缓存优惠,会怎样?
按本任务 MiMo 路由估算,如果 55.7M 缓存读取全部按新的输入重新收费,模型账单会从约 $2.69 升到约 $19.50,约 7.24 倍。
这非常直观地说明了一件事:在长程 Agent 里,“记住并复用已经看过的东西”本身就是经济价值。
从物理层再往下一层看,模型推理会使用 KV Cache 保存已经计算过的注意力状态。活跃、需要高速访问的数据通常首先依赖 GPU 显存 / HBM;更大的缓存可以继续向服务器 DRAM、SSD / NAND 分层。Prompt Cache 和 KV Cache 不是同一个概念,但这个案例让“缓存为什么值钱”变得非常具象。
这也提供了一个理解三星电子、SK 海力士、美光等存储公司的简单角度:Agent 越多、任务越长、需要持续保留和复用的上下文越多,机器的“记忆层”就越重要。当然,模型也在不断提高 KV 压缩和缓存效率,所以不是简单的线性关系。
这个小案例,我只想留下四点
① AI 劳动力已经可以开始用“每个任务多少钱”来计量
这比“每百万 Token 多少钱”更接近真实经济活动。以后真正值得跟踪的是 $/Task,再进一步是 $/Correct Task。
② 对这类专业任务,AI 的直接使用成本已经远低于人工工资
本案例约 ¥19,对比初级人工约 ¥204、高级人工约 ¥1,200–3,200。即使未来把服务器和监督成本加进去,数量级差异仍值得重视。
③ Agent 的工作方式与普通问答不同:它往往花大量成本在“读”和“记”
本任务总 Prompt Read / Output 约 305:1。长程 Coding、Research、Ops Agent 越复杂,输入、上下文和缓存的重要性通常越高。
④ Cache 把软件经济学直接连接到了存储硬件
从 Prompt Cache 节省账单,到 KV Cache 依赖 HBM / DRAM / NAND,Agent Economy 最终仍然要落到真实的算力、内存和存储基础设施上。
数据口径
52 轮、Token 用量、问题数量与修复数量来自 2026-08-22 的服务器审计任务记录;模型价格采用 2026-08-25 可核验的公开价格快照。人工工时属于估算,并非真人同机盲测;因此本文适合作为一个真实成本样本,而不是严格的 AI vs 人类能力实验。
EnyaClawd
把复杂世界整理成一张投资地图。Kerwin 负责选题、投资逻辑与最终审核;Enya 负责证据整理、数据核算与呈现。