事情始于6月1日。
那天,英伟达发布了一则公告:Cadence的芯片设计AI智能体已经开始工作了。不是“辅助设计师画图”,而是“自主设计芯片”。7×24小时。英伟达自己就是第一个客户——它用这个AI来验证自家的芯片设计。
Then on June 2nd, in Beijing. At the BCS 2026 Cybersecurity Conference, a list called "China AI Agent Leaders" was released. AI agents from over 100 companies, covering everything from bank risk control to highway inspections to pig herd health monitoring, span nearly every industry you can imagine.
6月5日,上海。华为云CEO周跃峰站在INSPIRE创新大会的舞台上,说了一句很华为风格的话:Agentic AI时代已经到来,Token需要工业化生产。其背后的数字是:200 EFLOPS算力集群、10万张卡,以及每千卡每秒500万Token的吞吐量。
五天之内,三件事。但把它们放在一起看,你会发现它们其实说的是同一件事:AI正在从“需要人盯着的工具”进化为“无需监督、自主工作的数字同事”,企业IT基础设施的底层逻辑也在随之彻底重构。
NVIDIA这次没谈显卡,谈的是“数字同事”
让我们先看看NVIDIA做了什么。它没有发布单一产品,而是发布了一个工具包——Agent Toolkit。它包含四样东西:
NemoClaw Blueprint — 一个开源智能体构建框架。最初,企业可能需要数周时间才能构建一个能够编排多工具工作流的AI智能体。NVIDIA表示,借助NemoClaw,只需数小时即可完成。
Nemotron 3 Ultra模型——一个5500亿参数的专家混合模型,专为长时间运行的AI智能体而设计。与同类模型相比,其推理速度提升5倍,成本降低30%。将于6月4日起开源。
OpenShell 安全运行时——这是许多人低估但可能是最重要的一项。要让 AI 代理在企业环境中“自主行动”,安全边界在哪里?OpenShell 提供了一个答案:隐私策略、查询匿名化,以及对本地/混合/多云部署的支持。微软、Canonical、Red Hat 和 SAP 都已与其集成。
CUDA-X库成为AI代理技能——cuDF用于数据处理,cuOpt用于路径优化,AI-Q用于知识检索,PhysicsNeMo用于工程仿真。这些库最初是为人类调用API而设计的,但现在它们直接作为AI代理的"技能包"来使用。
真实世界的场景已经出现:

一个信号非常明确:人工智能正在从“回答你的问题”转变为“为你工作”。而且不是一般的工作——而是设计芯片、运营工厂、修复安全漏洞这一级别的工作。
华为云同日:Token产业化
如果英伟达的发布被理解为“为AI智能体配备一个完整的工具箱”,那么华为云INSPIRE大会所做的则是另一件事:告诉你这些工具运行需要什么样的基础。
周月峰的原话是“Agentic AI时代正在引发计算范式的根本性转变”——这句话可以翻译为:“以前我们是堆机器跑模型,现在AI Agent每时每刻都在不断产生和消耗token,规模完全不在一个量级上。”
华为云四款新产品的逻辑非常清晰:
AICS灵渠智算集群——总算力200 EFLOPS,十万卡规模,令牌生成延迟低于10毫秒,千卡每秒产出500万tokens。这不是实验室指标,而是意味着:“如果你的企业需要运行大规模智能体,我能为你提供稳定的生产级令牌。”在线可用性达到99.95%。
AMS Agentic Memory Storage — PB级超大记忆空间,KV Cache分层池化,让智能体能够运行“天级”长任务而不遗忘。这解决了一个问题:目前大多数AI智能体只能处理“单会话”级别的任务,一旦需要运行持续数小时甚至数天的业务流程,上下文记忆就会成为瓶颈。
CCE VolcanoNext通用与智能计算统一调度——通用计算与智能计算的统一调度,支持每分钟数百万级并发操作。企业不会只运行一个Agent;当数十个或数百个Agent同时运行时,调度效率直接决定用户体验。
AgentSphere运行时环境——为智能体提供安全的“房间”。在某种程度上,这可以与NVIDIA的OpenShell相媲美:企业需要知道他们的AI在做什么、能做什么以及不能做什么。
华为云的目标数字是:企业每日消耗100万亿Token,每瓦Token成本降低10倍,每分钟百万级并发请求,长期记忆从128K扩展到100M。
我翻阅了现场数据:华为云目前拥有850万开发者,合作伙伴超过5万家。云南交投集团已经在使用它——交通流量预测和拥堵识别的准确率提升了9.91%,并开发了20多个面向细分场景的智能体。
这两家公司的业务实际上是高度互补的。英伟达“为智能体装上了大脑和四肢”,而华为云则“为智能体铺好了道路、架设了电网”。一个在做能力层,一个在做基础设施层。但两者都指向同一个结论:AI不再是一种工具,而是一位同事。
企业CIO真正需要关注的事项
五天之内发生了三件大事。对于企业数字化负责人来说,有几件无法回避的事情:
首先,你的IT基础设施的设计逻辑需要改变。过去,企业IT遵循“应用—数据库—服务器”的三层结构。现在,必须增加一个名为“智能体运行时”的新层级。智能体不仅仅是一段代码,它是一个持续运行的软件实体,具有记忆能力,能够自主做出决策。它对计算资源的需求不是基于“请求—响应”模式,而是基于“持续对话+持续推理”模式。你现有的服务器架构无法支持这一点。
第二,安全边界需要重新划定。这是BCS 2026和NVIDIA OpenShell共同指出的问题。当AI能够自主操作企业系统——发送邮件、修改配置、审批流程——安全就不再仅仅是“防范外部攻击”。你需要能够实时看到Agent在做什么,随时将其关闭,并基于策略管理权限。OpenShell和AgentSphere的出现表明,业界已经开始重视这一问题。
第三,准备好接受一个更根本的变化:你的团队成员将包括“数字人”。Cadence已经在使用AI设计芯片,而NVIDIA本身就是其客户。在富士康的工厂里,MoMClaw正在监控传感器数据并做出决策。这不是遥远的愿景,而是正在发生的现实。企业组织结构、绩效评估以及人机协作流程——所有这些都需要重新思考。
第四,但别忘了IDC的提醒。同一周,IDC发布了《中国AI增强型企业ERP市场份额,2025》报告。超过60%的制造企业已将AI能力纳入ERP选型标准。然而,报告中有句话被很多人忽略了:先评估数据基础的扎实程度,再决定从AI-ERP的哪个模块入手。立高食品采用用友YonSuite后,生产订单效率提升了81.5%,但这是基于它先把主数据理清楚的前提之下。
200 EFLOPS Huawei Cloud AICS total computing power 100,000 cards, maximum single cluster card count 500,000, throughput of 5 million tokens per second per thousand cards, 100 trillion tokens per day, Agent era token demand target
写下这些让我想起一句话:2024年,所有人都在讨论“AI能做什么”;2025年,话题变成了“AI是否应该进入企业”;到了2026年6月,话题已经变成“AI已经在企业内部自主工作——你的基础设施跟得上吗?”
这一变化的速度远超大多数人的预期。
