"NVIDIA GTC 2026:黄仁勋万亿算力预言、Agent时代与Token工厂的黎明" Best Partners TV 2026-03-18

大家好,这里是最佳拍档。

2026年3月16日,美国加州圣何塞的SAP体育馆迎来了科技界的年度盛事——英伟达GTC开发者大会。本次大会规模空前,吸引了来自一百九十个国家的近三万名与会者,四百五十家企业参与赞助,并设置了一千场专题论坛,两千位演讲者同台分享,堪比科技界的“超级碗”,已然成为全球AI产业发展的风向标。

黄仁勋的主题演讲一如既往地引人入胜,时长超过两小时。演讲中抛出的一个核心数字——1万亿美元——震撼全场。这是英伟达对截至2027年底,BlackwellVera Rubin两大算力系统的高置信度需求预测,相较于2025年给出的截至2026年底的五千亿美元预测,意味着在同等时间维度下,全球AI算力的核心需求直接实现了翻倍。黄仁勋直言,实际计算需求很可能还会超出预测,英伟达未来将面临持续的供不应求局面。

在这场演讲中,黄仁勋为我们完整描绘了一幅英伟达的转型蓝图:从一家单纯的芯片供应商,转变为AI工厂的建造者。这场转型背后,是AI产业从生成式迈向推理式,再全面进入Agent时代的全方位剧变,而这一切的连锁反应,正是英伟达对算力需求做出激进预测的根本原因。

回顾历史:Cuda 与 GeForce 的基石

在黄仁勋的所有演讲中,回顾历史是一个不变的起点。本次演讲的技术锚点落在了两个关键数字上:二十年和二十五年。2026年是 Cuda 诞生二十周年,同时也是 GeForce 诞生二十五周年,这两大产品构成了英伟达今日技术帝国的根基。

时间回到2006年,英伟达推出了 Cuda 并行计算平台,其核心发明是 SIMT(Single Instruction, Multiple Threads) 技术。这项技术的革命性在于,它让开发者能用编写普通单线程代码的方式,自动获得多线程并行执行的能力,门槛大幅降低。此后,英伟达在Cuda中引入了分块编程(Tile)技术,帮助开发者更轻松地处理张量运算,这项技术至今仍是现代AI数学的核心基础。二十年间,数千种工具、编译器、框架和开源库围绕Cuda建立,渗透到全球几乎所有行业的技术生态系统,成为加速计算的事实标准。

而Cuda的诞生,离不开二十五年前 GeForce 的铺垫。1999年,英伟达发明了世界上第一块可编程着色器,这是现代显卡的核心技术,也为五年后Cuda的推出奠定了硬件基础。黄仁勋在台上幽默地回顾了 GeForce 如何通过培养游戏玩家成为早期客户,再到他们长大成为付费客户的“飞轮模型”,引得全场笑声一片。这个模式庞大的装机基础吸引开发者,开发者基于硬件创造新的算法和技术突破,催生新的市场需求,新市场带动新的生态系统构建,更多企业加入生态进一步扩大装机基础,如此循环往复。

这个飞轮在AI时代正在不断加速。英伟达库的下载量庞大,增速持续加快。另一个反直觉的证据是,英伟达2020年推出的 Ampere 架构GPU在二手市场的价格不跌反涨。核心原因在于,英伟达的硬件支持AI生命周期的每一个阶段,加速每一种数据处理平台和科学求解器,使得基础设施的实际使用寿命远高于行业平均水平。

在GeForce和Cuda的技术基础上,英伟达的硬件技术持续演进。大约八年前推出的 RTX 架构成为了又一个关键节点,首次将硬件光线追踪和AI技术融合,让今天的神经渲染成为可能。大会上展示的 DLSS 5 技术,将可控的3D图形与生成式AI的概率计算深度融合,实现了既有惊艳的视觉表现,又能完全人工可控。

结构化与非结构化数据:AI时代的两大基础库

在回顾完技术历史后,黄仁勋点出了企业AI的核心主线:结构化信息与生成式AI的融合,将在一个又一个行业中不断重演。这成为了英伟达接下来所有技术布局的核心依据。

针对AI时代的两类核心数据,英伟达打造了两个至关重要的基础库:

  1. 结构化数据: 即SQL、Spark、Pandas、Snowflake、Databricks等工具处理的数据帧(Data Frame)。它们是记录企业全部业务信息的巨型电子表格,是企业业务的基本事实和核心计算依据。为此,英伟达推出了 Cuda数据帧加速库(cuDF),实现了对结构化数据处理的全流程GPU加速。

  2. 非结构化数据: 包括PDF、视频、演讲、邮件等形式,占全球每年新产生信息的约90%。这些数据因缺乏简单的索引方式,机器难以有效理解其语义。AI技术的发展解决了这个难题。英伟达针对非结构化数据推出了 Cuda向量搜索库(cuVS),专门实现了语义搜索与向量数据库的加速,释放了非结构化数据的价值。

围绕这两大基础库,英伟达公布了一系列重要的行业合作案例,包括IBM、雀巢、Google Cloud和AWS。特别值得一提的是,2026年英伟达将把 OpenAI 的服务正式带到AWS平台,这将直接带动海量的云计算消耗,进一步扩展OpenAI的计算能力。黄仁勋直言,OpenAI目前完全处于算力受限状态。此外,英伟达还与Palantir、Dell达成三方联合,实现了Palantir Ontology Platform的一站式本地化部署。

黄仁勋对英伟达的企业定位进行了精准总结:英伟达是世界上第一家垂直整合、横向开放的公司。垂直整合意味着从芯片硬件到软件库的全链路布局;横向开放则意味着技术会整合进任何合作伙伴想要的平台。支撑起所有行业加速计算的核心,正是英伟达的 Cuda X 库,黄仁勋称之为“皇冠珠宝”。本次大会上,英伟达发布了约70个新库和40多个更新版本。其中,**深度神经网络加速库(cuDNN)**最为重要,直接引爆了现代AI的技术大爆炸,成为深度学习研发的核心工具。

AI 产业爆发式增长:三大催化剂与Token工厂

在展示了各垂直行业的技术落地后,黄仁勋抛出了一个关于合作伙伴名单的幻灯片,密密麻麻写满了名字,字体小到难以辨认。这张幻灯片直观展示了英伟达生态的规模,合作伙伴涵盖了沃尔玛、欧莱雅、JP Morgan、罗氏、丰田等定义了现代社会主要行业的传统巨头,以及 OpenAIAnthropic 等AI原生公司。

这份名单的背后,是AI产业过去两年一千五百亿美元的爆发式增长,这是人类历史上最大规模的科技创业投资浪潮。其根本原因在于,这是历史上第一次,一个行业里的每一家公司,无论规模大小、所处领域,都需要算力,都需要大量的Token。黄仁勋将此变化比作新的计算平台迁移起点,堪比PC、互联网、移动互联网时代。

那么,AI基础设施的需求为何会出现如此爆炸式的增长?黄仁勋给出了三个核心催化剂:

  1. 生成式AI时代(以ChatGPT为代表): 生成式AI从根本上改变了计算性质,从读取、匹配数据转向生成全新数据。每一次生成都对应着海量的矩阵运算与Transformer推理,对算力的需求呈数量级跃升。
  2. 推理AI时代(以OpenAI o1为代表): o1 系列模型带来的核心突破是AI的自我反思、逻辑拆解、分步验证与事实锚定能力。这种深度推理能力让AI真正走向科研、金融、法律、医疗等高可靠性要求领域。但一次深度推理对话消耗的Token与计算量可能是普通生成对话的几十倍甚至上百倍,将AI的计算负荷再次推上新台阶。
  3. Agent时代(以Claude Code等产品开启): 黄仁勋明确判断,Claude Code 是第一个真正意义上实现规模化落地的软件Agent。英伟达内部100%的工程师团队都在使用Agent工具进行开发。Claude Code、Codex、Cursor等产品已深度嵌入软件工程的每一个环节,意味着AI的在线时长、调用频率、计算持续时间出现指数级上升。

这三大催化剂共同推动AI走完了从感知、生成、推理到行动的进化路径。AI开始真正进入生产流程,承担高价值、长流程、强逻辑的工作。这一转变带来了惊人的行业数据:过去两年,单次AI推理所需的计算量增长约1万倍,全球AI实际使用量同步增长约一百倍,两者相乘,全球AI整体计算需求在短短两年内增长了约100万倍。

黄仁勋直白地总结了所有AI公司的共同处境:“只要给我更多算力,我就能生成更多Token,就能服务更多用户,做出更先进的模型,实现更大的商业价值。”AI公司正处在正向飞轮彻底起飞的临界点。

Token工厂:AI算力的商业模式与硬件迭代

在此背景下,黄仁勋系统阐述了他眼中AI产业最核心的商业模式——Token工厂。他戏称这是一张“用来折磨所有人”的幻灯片,但强调这是未来几年理解AI基础设施最重要的一张图。

Token工厂的逻辑起点是一个无法突破的物理约束:数据中心的功率上限是固定的。在固定功率下,衡量AI计算系统价值的核心指标有两个:

  1. 吞吐量: 单位功率下能生产多少 Token,决定工厂的“产能效率”。
  2. Token速度: 每秒能生成多少 Token,决定AI的响应快慢,即“聪明程度”。

这两者之间存在天然的工程矛盾:深度推理、长文本、复杂决策速度慢、吞吐量低;高并发、批量处理、简单生成则可追求极致吞吐量。AI工厂的核心并非单一指标的极限追求,而是在固定功率约束下,对不同任务进行分层、调度、定价,实现整体收益的最大化。

基于此,黄仁勋将英伟达的Token服务划分为五个清晰的价格层级:免费层、基础层、进阶层、高速层、顶级实时层,价格从0到每百万Token 150美元。对于需要实时决策、极低延迟、高可靠性的企业场景,150美元/百万Token的价格对应的是业务可用性和竞争力,成本完全可被商业价值覆盖。

这套分层定价体系本质上是将AI算力从硬件产品变成了工业化产能,把GPU数据中心变成了7x24小时不间断运行的Token工厂。而决定工厂效益的核心,是算力架构的代际差距。根据SemiAnalysis的基准测试,Grace Blackwell NVLink 72 系统相比上一代 Hopper 架构,每瓦 Token 产量提升超过50倍。云厂商的运营数据也印证了这一点,通过升级英伟达最新的软件栈,Token 生成速度大幅提升,业务规模也同步增长。

从商业收益角度,黄仁勋测算,在同等1吉瓦功率的AI工厂里,Grace Blackwell 对比 Hopper 可让数据中心收入提升约5倍;新一代 Vera Rubin 对比 Grace Blackwell 还能再提升约5倍。两代升级叠加,理论上可带来25倍的收入弹性。这也是他反复向企业客户强调的:尽快迁移到 Vera Rubin 架构。

Vera Rubin:Agent时代的超级计算引擎

在正式推出 Vera Rubin 之前,黄仁勋回顾了英伟达过去十年的算力演进路线:2016年的 DGX 1(配备8颗Pascal GPU与第一代NVLink,算力170 TFlops,黄仁勋亲手送给OpenAI),DGX 2 引入 NVLink SwitchDGX A100 依托Mellanox实现纵向与横向扩展成熟,Hopper 架构推出 FP8 Transformer Engine 点燃生成式AI,BlackwellNVLink 72 重构超算体系。十年间,英伟达AI算力提升达到四千万倍,远超摩尔定律。

本次大会的绝对主角,就是为 Agent 时代全新设计的超算系统——Vera Rubin。它完全围绕Agent AI的三大痛点设计:模型越来越大、存储与互联带宽瓶颈、对外部工具延迟敏感。

Vera Rubin 由七大芯片、五大系统深度整合而成,不再是简单的服务器堆叠,而是一台真正的“巨型计算机”。作为核心推理引擎的 Vera Rubin NVLink 72,整机算力达到3.6 EFlops,第六代 NVLink 提供每秒260 TB的全互联带宽。整套系统由72颗Rubin GPU与36颗Vera CPU构成,全面采用45℃热水液冷,两小时即可完成过去需要两天才能安装的机架部署。黄仁勋强调,这是全球唯一量产的第六代多GPU全局互联交换机。

本次大会另一个重磅突破是英伟达推出的全新设计张量计算单元NVFP4精度格式,在推理场景下无精度损失,大幅提升能效与性能,并同时支持训练与推理。

为了解决极致低延迟推理的需求,英伟达宣布与Groq达成深度技术合作,并推出 Groq 3 LPU。Groq的核心思路是编译阶段预排所有计算时序,运行时无动态调度,内置超大容量 SRAM,专为低延迟推理优化。单颗 Groq 3 LPU 拥有500MB片上SRAM,FP8算力1.2 PFlops,片上带宽高达每秒150TB。

受限于芯片面积,外部存储容量有限,无法单独支撑超大模型。因此英伟达提出了分解式推理架构:通过Dynamo调度系统,将推理分为预填充(由 Vera Rubin 负责,利用大显存与高吞吐处理长上下文)和逐 Token 生成(交给 Groq 3,利用极低延迟快速输出)两个阶段。两者通过专用低延迟网络协同,整体延迟降低约50%,最高实时性区间性能提升35倍。黄仁勋的企业部署建议是:高吞吐为主可100%采用 Vera Rubin;对实时性要求高的场景,可按约25% Groq 3 加75% Vera Rubin 的比例配置。

Vera CPU 是英伟达在通用计算上的意外惊喜,是全球唯一采用低功耗LPDDR5内存的数据中心CPU,专为Agent的任务调度、数据处理、控制面工作负载设计,销量超出预期,已成为数百万美元级的独立业务。

BlueField-4 STX 重构了AI时代的存储架构,因AI访问模式与人类不同,整个存储行业正被AI重新定义。BlueField-4 STX 提供的计算存储分离、弹性卸载、安全多租户能力成为新一代AI数据中心的标配。

Spectrum-X CPO 是全球首款量产共封装光学交换机,将光引擎直接封装在交换芯片上,省去电信号转换与高速背板损耗,大幅降低功耗与延迟,为未来EB级带宽的AI集群提供基础网络支撑。

Rubin Ultra 采用全新 Kyber 机架设计,计算节点竖向插入,单机架支持一百四十四颗GPU全局 NVLink 互联,整机就是一台超算。黄仁勋预测,未来两年内,同样1吉瓦的AI工厂,Token 生成速度将从每秒两百万提升到每秒七亿次,增长三百五十倍,AI的能力边界、应用场景、商业价值将同步出现数量级的扩张。

英伟达也公开了 Vera Rubin 之后的完整技术路线图:Blackwell 世代基于 Oberon 机架;Vera Rubin 支持 NVLink 72 与光学扩展;2027年推出 Vera Rubin UltraKyber 机架,支持 NVLink 144);2028年推出全新 Feynman 架构(集成Groq联合研发的 LP40 技术,搭配 Rosa CPUBlueField 5ConnectX 10),全面支持铜缆与共封光互联双路线。英伟达以每年一代架构的速度,持续锁定AI算力的领先地位。

AI工厂数字孪生与太空AI数据中心

在硬件之外,本次大会的战略级发布是 NVIDIA DSX,基于 OmniverseAI工厂数字孪生平台。一座吉瓦级AI数据中心涉及数十家供应商,传统模式下协同设计不足导致能耗浪费与性能损耗。DSX 让所有合作伙伴在数字孪生世界中联合设计、仿真、测试、运营,从源头优化工厂的能效与吞吐量。DSX 包含四大模块:DSX M(物理、电气、热力、网络仿真)、DSX Exchange(运营数据与电网对接)、DSX Flex(动态调配功率)、DSX MaxQ(Agent实时优化 Token 产能)。黄仁勋判断,仅通过数字孪生优化,就可让AI工厂整体效率再提升两倍。

更具未来感的布局是英伟达提出的 Vera Rubin Space 1太空AI数据中心计划。目前英伟达已有抗辐射GPU在卫星上执行实时图像处理,太空数据中心的最大挑战是散热。英伟达工程团队正在攻克难题,未来太空AI数据中心将为遥感、深空通信、近地轨道计算提供不受地面限制的算力资源。

OpenClaw:Agent计算的操作系统

如果说 Vera Rubin 是Agent时代的硬件底座,那么 OpenClaw 就是黄仁勋眼中Agent的操作系统。他用近半小时讲解了 OpenClaw 的战略意义,将其定位为Agent计算的操作系统。

OpenClaw 的核心价值在于解决当前Agent碎片化、不可靠、难协作、难监管的问题。它提供标准化的接口、工具调用规范、记忆管理机制、多Agent协同协议与安全沙箱,使得个人助手、企业客服、代码Agent、数据分析Agent、工业控制Agent等都能在 OpenClaw 上统一构建、部署、监控、审计。

为满足企业级安全与合规需求,英伟达同步推出 NemoClaw。在 OpenClaw 基础上增加了权限管理、数据脱敏、操作审计、模型隔离、隐私计算等能力,让Agent可以在金融、医疗、政务等高敏感领域落地。黄仁勋认为,Agent将彻底重构下一代企业IT。未来的企业IT将以Agent为中心,通过 OpenClaw 这类标准框架连接所有系统、所有数据、所有工具,员工只需与Agent对话即可完成复杂业务流程。Agent时代的变革深度将远超PC与互联网时代。

模型生态与物理AI:Agent能力的全面拓展

在模型生态层面,英伟达正式推出 NemoTron联盟,通过巨额研发投入构建开放、可商用、可微调、可部署的全场景模型体系,覆盖文本、语音、视觉、多模态、代码、推理、Agent等全领域。本次大会发布的 NemoTron 3 在性能、效率、长上下文能力上大幅提升,并保持对开发者友好的许可协议,允许企业商用、二次分发、私有化部署。联盟成员包括全球顶尖AI公司、云厂商、研究机构与行业企业。英伟达承诺持续迭代、持续开源、持续向下兼容,避免厂商锁定,让开放模型真正成为AI产业的基础设施。

物理AI具身智能领域,英伟达也公布了重磅进展。黄仁勋宣布,自动驾驶正式进入ChatGPT时刻。新一代自动驾驶AI模型 Alpamayo 不再依赖规则与人工标注,而是通过端到端推理与自我进化,在海量仿真与真实数据中学习人类驾驶的常识与决策逻辑。配合英伟达 Drive 平台与海量路测数据,Alpamayo 使自动驾驶从辅助驾驶真正走向智能驾驶,合作伙伴覆盖全球主流车企与自动驾驶科技公司,量产进程全面加速。

机器人领域是英伟达深耕十年的赛道。大会现场展出了110台各类机器人,涵盖工业制造、物流仓储、服务零售、医疗康复、家庭陪伴等场景。英伟达 Isaac 仿真引擎与机器人操作系统,为机器人提供从算法研发、模型训练、场景仿真到部署落地的全流程工具链。黄仁勋现场与机器人进行了互动,展示了其在精准操作、人机协同、环境理解上的最新能力。

演讲最后,黄仁勋带来了两个充满趣味的彩蛋:

  1. 与迪士尼合作的雪宝机器人:基于英伟达物理AI与实时渲染技术,雪宝可以自然对话、生动表情、精准交互,视觉效果与互动体验接近电影级水准。
  2. AI全程生成的说唱MV:从文本、歌词、旋律、人声、画面到视频剪辑,完全由英伟达AI模型生成,展示了AI在内容创作上的完整生产力。

以上就是本次GTC的完整内容,希望能对大家有所帮助。感谢收看,我们下期再见。

📌 文中提及的人物和组织

关键字: agent-computing token-factory ai-infrastructure gpu-evolution computational-platforms