a16z 最新一期《Charts of the Week》报告指出,AI Agent 的数量正在快速增加,其 Token 消耗量已接近普通人类用户使用量的 5 倍;自今年 2 月以来,Agent 使用量更增长约 14 倍。
a16z 认为,这一变化背后还可能带来另一个硬件层面的赢家:高带宽内存(HBM)。原因是 Agent 的工作方式高度依赖 Cached Token(缓存 Token),与一般用户“一问一答”的聊天模式完全不同,可能进一步推升 AI 基础设施对内存的需求。
企业 AI 使用两极分化,头部企业 Token 用量拉开 8 倍差距
a16z 引述 OpenAI 数据指出,企业 AI 使用量普遍增加,但成长并不平均。自 2025 年 4 月以来,一般企业的 Output Token 大约增加一倍,但使用量排名前 10% 的企业已增长超过 17 倍。目前前 10% 企业与典型企业之间的 Token 输出量差距约达 8 倍。
在信息技术产业,差距更接近 12 倍,其中前 10% 企业的 Token 输出量已经是约一年前的 32.5 倍。这意味企业 AI 市场正从“有没有使用 AI”,逐渐转向“AI 深入工作流程到什么程度”。
重度使用企业已不再只把 AI 当聊天机器人。a16z 指出,前 10% 企业的 Plug-in(插件)采用率约为典型企业的 2 倍,Skills(技能)采用率则达约 6 倍。
值得注意的是,近期进展最快的产业甚至不是科技业。若以 Codex 采用率衡量进阶 AI 工具使用程度,法律产业自 2026 年 2 月以来采用率暴增 108 倍。不过 a16z 提醒,其中有多少来自 Codex 本身扩大推出,目前仍难以区分。
Agent 吃掉大量 Token,缓存读取是主因
a16z 引述 OpenRouter 与 Peter Walker 整理的数据指出,目前真正部署完整 Agent 的 AI 使用者仍只占少数,但 Agent 已经消耗极为庞大的 Token。目前 Agent 使用的 Token 量接近人类用户的 5 倍,而 Agent 使用量自今年 2 月以来已增加约 14 倍。
普通用户使用 ChatGPT、Claude 等 AI 工具时,通常采取“Prompt → Response”模式。但 Agent 接收任务后,需要持续读取信息、调用工具、写入结果,再根据前一步输出进行下一轮操作。换句话说,一个人可能只送出一次指令,但 Agent 在完成任务前,可能自行运作许多轮。
OpenRouter 数据显示,超过 85% 的 Agent Token 消耗来自 Cached Prompt,而近期 Agent Token 使用量增加,也几乎都是由 Cached Token 推动。原因是 Agent 开始执行任务时,需要先载入大量背景信息,例如系统规则、代码规范、公司政策以及任务 Context。完成初始 Prefill 后,Agent 不必每一次推理都重新载入全部内容,而是持续利用已快取的 Context,再逐步读写新信息。
Cached Token 的成本通常比重新执行 Prefill 更低,有利于降低 Agent 长时间运行的推理成本;但另一方面,这种模式对内存资源的需求也更高。
a16z 因此将 Agent 的崛起与目前 HBM 的强劲需求联系起来:当大量 Agent 同时持续运行,并且不断保存、重复使用 Context,AI 推理基础设施除了需要 GPU 算力,也需要大量高带宽内存支撑。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。