这篇文章给出一套可复算的测算框架。先说结论:现有AI基础设施足够全人类"轻度使用",大约够十几亿人"中度使用",但只够约50万~100万个全天候重度Agent集群运转。Agent经济一旦起量,需求是今天的两个数量级以上——这就是算力资本开支看不到头的需求侧逻辑。
本文主要讨论对算力的需求,未来会专门写关于对存储、电力的需求影响。
〇、测算框架:一条换算链
所有AI消耗都可以归到一个统一计量单位——token。任务难度差异,本质是token消耗量的差异;token再向下换算成算力、电力、存储:
任务 → token数 → 算力(FLOP) → GPU·时 → 电力(Wh)
供给侧反过来:全球算力/电力 ÷ 单体日耗 = 可支撑的人数或Agent数
四个关键换算系数(依据见文末,均为2026年规模化推理的"全包口径"):
| ≈0.5 Wh | ||
| ≈1×10¹¹ FLOP | ||
| ≈5000 token/秒 | ||
| ≈4 KB |
注:单位能耗口径争议大(0.1~2 Wh/千token都有人算),本文取中位区间,所有结论自带±3倍误差带,但不影响数量级判断。
一、一个人的一天:跨度3个数量级
先看单次任务的消耗阶梯——任务难度每上一级,token消耗大约上一个数量级:
把任务组合成一天的画像,分四档(条形图为对数刻度):
L1 轻度尝鲜:问几句、改个文案 | 1.5万 token · 7.5 Wh(≈手机充电半次)
L2 中度知识工作者:写作+翻译+几十轮对话 | 30万 token · 0.15 kWh(≈笔记本用一下午)
L3 重度专业用户:全天Copilot+几次深度研究+多模态 | 500万 token · 2.5 kWh(≈中国人均一天生活用电)
L4 极限个人:开发者挂着Agent干活 | 5000万 token · 25 kWh(≈电动车充半箱电)
从1.5万到5000万token,一个人的日用量跨度约3300倍,3个半数量级。但注意:L4的"人"其实已经不是人在消耗,而是他名下的Agent在消耗——人每天读得完的token撑死几十万(按400字/分钟×10小时≈30万token),人类的直接消耗存在生理天花板,超出部分全部来自委托给机器的计算。这是理解下一节的钥匙。
二、一个Agent的一天:同样的阶梯,但上不封顶
Agent的消耗逻辑与人不同:它不睡觉、不疲劳、可以并行分身,token消耗与"思考时长"解耦。同样分四档:
| A1 定时任务型 日报、摘要、监控告警 | |||
| A2 工作流型 客服bot单实例、运营自动化 | |||
| A3 自主长任务型 编码/研究Agent连续作业 | |||
| A4 多Agent集群 7×24h规划-执行-验证流水线 |
A1 30万/天
A2 500万/天
A3 1亿/天
A4 10亿/天(对数刻度,实际是A1的3300倍)
这些不是纸面数字:Anthropic企业数据显示编码Agent重度用户月耗2亿~10亿token,有开发者8个月烧掉100亿token(折合每天约4000万);字节披露豆包日均调用已达120万亿token,增长主力恰恰是"AI视频生成+Agent普及"。一个A4集群一天500度电,相当于一个中国家庭一两个月的用电量,等效把2~3张H100据为己有。
关键结论:人的需求曲线有天花板,Agent的需求曲线没有。token消耗第一次与人类注意力脱钩,需求理论上只受预算和算力供给约束。
三、全球供给盘点:够多少人、多少Agent用?
2026年年中,三类供给的家底:
| 算力 | ||
| 电力 | ||
| 存储 |
交叉验证:实测吞吐500万亿 < 电力口径1200万亿 < 算力理论上限5800万亿,三口径递进自洽(缺口=利用率、峰谷、长上下文开销)。反向验证:500万亿token×0.5Wh/千token≈10.4 GW,与Epoch"全球AI芯片功耗超10 GW"吻合。
用三种口径除以单体日耗,得到本文的核心表格——现有供给可同时支撑的数量:
(实测500万亿/天) | (25GW推理) | ||
| 全人类绰绰有余 | |||
| 全球知识工作者刚好够 | |||
| 仅够头部专业人群 | |||
| 企业级普及即触顶 | |||
| 不到全球程序员的¼ | |||
| 50万个 | 120万个 | 全球只够百万级 |
存储为什么不在表里?因为它不构成约束:80亿人天天中度使用,文本+日志一年仅新增约0.015 ZB,占年出货量的0.7%;就算1亿个Agent每天各产1GB中间产物,一年也只占出货量的约2%。真正吃存储的只有AI视频(1分钟720p约50~100MB),这正是豆包token暴涨的主因之一。
瓶颈排序(由松到紧)
① 存储:数量级富余,文本时代永远够用,视频时代才需要重估;
② 算力:芯片年增3.3倍是全场最快变量,但微软称"紧张至少持续到2026年底"——短期瓶颈;
③ 电力:IEA预计数据中心用电2030年翻倍至945 TWh,而电网/变电站建设周期5~10年,远慢于芯片7个月翻倍——长期真瓶颈。
四、核心结论
1.用量跨度:人是3个数量级,Agent是"3个数量级且上不封顶"。一个人一天1.5万~5000万token(7.5Wh~25kWh),天花板是注意力;一个Agent一天30万~10亿+token(0.15~500kWh),没有天花板。
2.现有家底:人类用不完,Agent一下就用完。500万亿token/天的实测供给,够333亿"轻度人类",却只够50万个全天候Agent集群——全球供给÷重度Agent单耗,得数只有百万级。
3.需求侧的200倍缺口。若全球10亿知识工作者每人配一个A3级Agent,日需求10万万亿(1×10¹⁷)token,是当前实测吞吐的200倍、理论上限的17倍。即便效率每年提升3~10倍(Google单条提示能耗一年降33倍),按豆包两年1000倍、Google一年7倍的需求增速,缺口依然以年为单位扩大——杰文斯悖论在token上体现得淋漓尽致。
五、误差与敏感性声明
本文是数量级测算而非精确核算:①单位能耗取0.5Wh/千token,乐观/悲观口径±2倍;②"实测全球吞吐500万亿/天"基于各家自报数拼接,可能漏算自部署开源模型(偏低)也可能含多模态token虚增(偏高);③H100利用率取25%,行业实际15%~40%;④推理/训练算力分配取⅔,各家披露不一。所有结论在±3倍内稳健,数量级判断不受影响。效率改善(芯片性能/瓦特年增约2~3倍、模型蒸馏与推测解码等)会持续抬高"可支撑数量",但历史经验是需求增速(年7~10倍)始终快于效率增速。
六、数据依据
[1]Google Cloud/MIT Tech Review(2025.8):Gemini中位文本提示0.24Wh、0.26ml水,单位能耗12个月降33倍
[2]Sam Altman(2025.6):ChatGPT平均查询约0.34Wh
[3]Google I/O 2026(2026.5):月处理3.2千万亿(quadrillion)token,同比7倍(2024年同期仅9.7万亿/月)
[4]火山引擎/36氪(2026.3):豆包大模型日均调用120万亿token,两年增长1000倍
[5]OpenAI(2026):ChatGPT周活约10亿,日查询28亿次;API吞吐150亿token/分钟≈21.6万亿/天
[6]Microsoft FY26Q3财报(2026.4):300+客户年处理超1万亿token;算力供给"至少紧张到2026年底"
[7]Epoch AI(2026.1):全球AI算力超1500万张H100等效(年中约2000万),年增3.3倍;五大超大规模厂商占71%;芯片功耗超10GW
[8]IEA《Energy and AI》(2025):全球数据中心485TWh(2025)→945TWh(2030),AI专用数据中心电耗到2030年增逾4倍
[9]McKinsey/Deloitte(2025-26):AI推理功率20.9GW(2025)→93.3GW(2030);2026年推理约占AI算力⅔
[10]存储行业(TrendForce/Tom's Hardware等):企业级HDD装机约19ZB(2025)、年出货约2.78亿块;容量口径HDD≈SSD的2.5倍
[11]MIT Technology Review:5秒AI视频能耗≈微波炉运转1小时以上;Anthropic企业数据:编码Agent重度用户月耗2亿~10亿token
— 完 —
测算框架可复用:任务→token→FLOP→GPU·时→电力,供给÷单耗=规模