首页 > AI教程 >黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

作者:骑光打字机 2026-08-25 11:29:15

英伟达GTC大会发布BlackwellUltra、Rubin及Feynman三代AI芯片,推出DGXStation与DGXSpark个人超算,后者算力每秒1000万亿次。DeepSeek-R1推理速度创全球最快,每用户超250token/s。AI竞争重心转向推理效率与成本,同步发布AI工厂操作系统Dynamo。

如今,AI 行业的竞争规则正在发生变化:较量的重点已不再是谁拥有更强的算力堆叠能力,而是谁能够把模型推理成本降得更低、把效率做得更高。这一判断,几乎贯穿了今年英伟达 GTC 大会整场主题演讲。黄仁勋在现场多次强调一个关键词——英伟达要成为“AI 工厂”,即建设一种能够让 AI 以超越人类速度进行学习和推理的基础设施。

而此次发布的一系列新产品,也在传递同样的信息:未来 AI 竞赛的关键,不在于模型参数规模有多大,而在于谁能把推理成本压到更低、把推理效率提升到更高。

长期稳定更新的攒劲资源: >>>点此立即查看<<<

除了全新 Blackwell 芯片,还有两款“真·AI PC”

全新的 Blackwell 芯片代号为“Ultra”,即 GB300 AI 芯片。作为去年“全球最强 AI 芯片”B200 的后续产品,它再次抬高了性能上限。

此次发布主要包括两套方案:英伟达 GB300 NVL72 机架级解决方案,以及 HGX B300 NVL16 系统。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

Blackwell Ultra GB300 NVL72 计划于今年下半年发布。其核心参数较为清晰:单颗 Blackwell Ultra 芯片保持与上一代相同的 20 petaflops AI 性能,同时将内存升级至 288GB HBM3e。

如果说 H100 更擅长训练大模型,B200 更偏向推理任务,那么 B300 则覆盖更全面——无论是预训练、后训练,还是 AI 推理,均可胜任。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

英伟达还提到,Blackwell Ultra 同样适用于 AI 智能体部署,以及用于训练机器人和汽车自动驾驶的“物理 AI”。为进一步提升系统性能,它还将集成 Spectrum-X 以太网和 Quantum-X800 InfiniBand 平台,为每个 GPU 提供 800Gb/s 的数据吞吐能力。这套配置的核心目标,是帮助 AI 工厂和云数据中心更高效地处理推理模型。

除 NVL72 机架外,英伟达还面向台式机用户推出了 DGX Station,搭载单颗 GB300 Blackwell Ultra 芯片。该主机配备 784GB 统一系统内存,内置 800Gbps 的 ConnectX-8 SuperNIC 网络,同样可提供 20 petaflops 的 AI 性能。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

此前在 CES 2025 亮相的“迷你主机”Project DIGITS,如今正式定名为 DGX Spark。它搭载专为桌面场景优化的 GB10 Grace Blackwell 超级芯片,每秒可提供高达 1000 万亿次 AI 计算操作。这台设备可用于微调和推理最新 AI 模型,包括 NVIDIA Cosmos Reason 世界基础模型和 GR00T N1 机器人基础模型。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

按照黄仁勋的设想,借助 DGX Station 和 DGX Spark,用户既可以在本地运行大模型,也可以将其部署到 DGX Cloud 或其他加速云与数据中心中。正如他所说,“这就是 AI 时代的计算机。”

目前,DGX Spark 已开放预订,DGX Station 预计将于今年晚些时候由华硕、戴尔、惠普等合作伙伴推出。

下一代 AI 芯片 Rubin 官宣,2026 年下半年推出

英伟达长期以来习惯以科学家名字命名其架构,这已成为企业文化的一部分。此次也延续了这一传统,下一代 AI 芯片平台被命名为“Vera Rubin”,以纪念美国著名天文学家薇拉·鲁宾。

黄仁勋在演讲中给出了一组对比数据:Rubin 的性能将达到 Hopper 的 900 倍,而 Blackwell 相比 Hopper 已实现 68 倍提升。这组数据本身已具备较强说明力。

其中,Vera Rubin NVL144 预计将在 2026 年下半年发布。其关键信息如下:

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

标准版 Rubin 将配备 HBM4,性能相较 Hopper H100 将有明显提升。它还引入了 Grace CPU 的后续产品 Vera,包含 88 个定制 Arm 核心,每个核心支持 176 个线程,并通过 NVLink-C2C 实现 1.8 TB/s 的高带宽连接。英伟达表示,定制版 Vera 的速度相比去年 Grace Blackwell 芯片所使用的 CPU 提升了一倍。

与 Vera CPU 配合时,Rubin 在推理任务中的算力可达到 50 petaflops,超过 Blackwell 的 20 petaflops 两倍。内存方面,Rubin 支持最高 288GB HBM4,这也是 AI 开发者高度关注的规格之一。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

值得注意的是,Rubin 实际上由两个 GPU 组成,这一设计与 Blackwell 相似——后者同样通过将两个独立芯片组合为一个整体来运行。不过从 Rubin 开始,英伟达将不再像 Blackwell 那样把多 GPU 组件视作单个 GPU,而是按照实际 GPU 裸片数量进行更准确的计数。

互联技术也同步升级。Rubin 将配备第六代 NVLink,以及支持 1600Gb/s 的 CX9 网卡,从而显著提升数据传输能力和连接性能。

除标准版外,英伟达还计划推出 Rubin Ultra 版本。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

Rubin Ultra NVL576 计划于 2027 年下半年推出,参数细节如下:

在硬件配置方面,Rubin Ultra 的 Veras 系统延续了 88 个定制 Arm 核心设计,每个核心支持 176 个线程,并通过 NVLink-C2C 提供 1.8 TB/s 带宽。GPU 方面,Rubin Ultra 集成 4 个 Reticle-Sized GPU,每颗 GPU 提供 100 petaflops 的 FP4 计算能力,并配备 1TB HBM4e 内存,性能和内存容量均进一步提升。

为适应快速变化的市场环境,英伟达的产品发布时间节奏已缩短至一年一代。发布会上,黄仁勋还正式公布了下一代 AI 芯片的命名——Feynman,以物理学家费曼命名。

随着 AI 工厂规模持续扩大,网络基础设施的重要性也日益上升。为此,英伟达推出了 Spectrum-X 和 Quantum-X 硅光网络交换机,目标是帮助 AI 工厂实现跨站点连接数百万 GPU,并显著降低能耗与运营成本。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

Spectrum-X Photonics 交换机提供多种配置方案:

与其配套的 Quantum-X Photonics 交换机基于 200Gb/s SerDes 技术,提供 144 端口 800Gb/s 的 InfiniBand 连接,并采用液冷设计对板载硅光子组件进行高效散热。相较上一代产品,Quantum-X Photonics 交换机为 AI 计算架构带来 2 倍速度与 5 倍可扩展性。

Quantum-X Photonics InfiniBand 交换机预计将于今年晚些时候上市,Spectrum-X Photonics 以太网交换机则预计在 2026 年推出。

AI 的快速发展,对数据中心带宽、低时延和高能效提出了更高要求。英伟达 Spectrum-X Photonics 交换机采用名为 CPO 的光电子集成技术,其核心是将光引擎与传统电子芯片集成在同一封装中。该技术的优势较为直接:传输效率更高、功耗更低、体积更小,也进一步提升了空间利用率。

AI 工厂的“操作系统”Dynamo

黄仁勋在演讲中提出,未来每个行业、每家公司都将拥有两座工厂:一座是实际生产的工厂,另一座则是 AI 工厂。而 Dynamo,正是专门为“AI 工厂”打造的操作系统。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

Dynamo 是一个分布式推理服务库,本质上是为“需要 token 但又无法获得足够 token”的问题提供开源解决方案。其优势主要体现在四个方面:GPU 规划引擎,可动态调度 GPU 资源以适应需求变化;智能路由器,可减少 GPU 对重复请求的重复计算,释放算力处理新请求;低时延通信库,用于加速数据传输;内存管理器,则可在低成本内存与存储设备之间智能处理推理数据。

人形机器人的亮相环节依然保留

人形机器人再次成为 GTC 大会的压轴内容。此次英伟达带来了 Isaac GR00T N1,这是一款全球首个开源人形机器人功能模型。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

黄仁勋表示,通用机器人技术的时代已经到来。借助 Isaac GR00T N1 核心数据生成能力以及机器人学习框架,全球机器人开发者将进入 AI 时代的下一个前沿领域。

该模型采用“双系统”架构,模拟人类认知机制:在视觉语言模型支持下,系统 2 对环境和指令进行推理并规划动作;系统 1 则将这些规划转化为机器人的实际行动。GR00T N1 的基础模型已经基于广义类人推理和技能完成预训练,开发者可通过真实或合成数据进行后训练,以满足特定需求——无论是工厂中的特定任务,还是家庭中的自主家务场景。

黄仁勋还宣布了与 Google DeepMind 和 Disney Research 联合开发的开源物理引擎 Newton。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

一台搭载 Newton 平台的机器人也在现场登台亮相。黄仁勋称其为“Blue”,其外形与《星球大战》中的 BDX 机器人相似,并能够通过声音和动作与他互动。

8 块 GPU,DeepSeek-R1 推理速度创全球之最

英伟达实现了全球最快的 DeepSeek-R1 推理速度。官网信息显示,一台搭载 8 个 Blackwell GPU 的 DGX 系统,在运行 6710 亿参数的 DeepSeek-R1 模型时,可实现每位用户每秒超过 250 个 token 的速度,最高吞吐量可超过每秒 30000 个 token。

通过硬件与软件协同优化,自今年 1 月以来,英伟达在 DeepSeek-R1 671B 模型上的吞吐量提升约 36 倍,每个 token 的成本效率提升约 32 倍。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

为实现这一结果,英伟达完整的推理生态系统已针对 Blackwell 架构进行了深度优化。其不仅整合了 TensorRT-LLM、TensorRT Model Optimizer 等工具,同时无缝支持 PyTorch、JAX 和 TensorFlow 等主流框架。在 DeepSeek-R1、Llama 3.1 405B 和 Llama 3.3 70B 等模型上,采用 FP4 精度的 DGX B200 平台,相较 DGX H200 平台,推理吞吐量提升超过 3 倍。

值得注意的是,此次主题演讲并未提及量子计算,但英伟达仍在本届 GTC 大会中专门设置了量子日,并邀请多家量子计算公司的 CEO 出席。此前,黄仁勋曾在年初表示“量子计算还需要 20 年才具备实用性”。而如今相关讨论升温,也与微软耗时 17 年研发的拓扑量子芯片 Majorana 1 实现 8 个拓扑量子比特集成,以及 Google Willow 芯片宣称在 5 分钟内完成经典计算机需要 10^25 年处理的任务等进展有关,这些进展持续推动量子计算热度上升。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

芯片仍然是整场发布的核心,但部分软件产品的亮相同样值得关注。硅谷投资人马克·安德森曾提出“软件正在吞噬世界”的观点,其核心逻辑在于,软件通过虚拟化、抽象化和标准化,正逐步成为控制物理世界的基础设施。

英伟达显然并不满足于仅仅扮演“卖铲人”的角色。其目标是打造 AI 时代的“生产力操作系统”。从汽车智能驾驶到制造业数字孪生工厂,贯穿整场发布会的案例,本质上都是将 GPU 算力转化为行业生产力的具体呈现。

黄仁勋发布三代AI芯片,个人超算算力达每秒1000万亿次,DeepSeek受益最大

在对比 Blackwell 与 Hopper 架构时,黄仁勋也延续了其一贯的幽默表达。他以一个 100MW 工厂为例:采用 Hopper 架构需要 45000 颗芯片和 400 个机架,而 Blackwell 架构凭借更高效率,显著降低了硬件需求。随后,他再次抛出那句经典总结——“the more you buy, the more you save”。紧接着,他又补充一句:“the more you buy, the more you make”。

随着 AI 产业重心从训练逐渐转向推理,英伟达更需要证明其软硬件生态在推理场景中的不可替代性。一方面,Meta、Google 等大型企业自研 AI 芯片,可能对 GPU 市场需求形成分流;另一方面,最新 AI 芯片的及时亮相,既是对 DeepSeek 这类开源模型可能冲击 GPU 需求的回应,也是展示其在推理领域技术优势、缓解市场对训练需求见顶担忧的重要一步。

对于近期估值跌至十年低位的英伟达而言,它比以往任何时候都更需要一场明确而有力的胜利。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备2026025700号-3 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。