英伟达Rubin GPU详细架构首次曝光 性能提升达十倍
时间:2026-07-23 | 作者:318050 | 阅读:07月23日,英伟达正式发布了Rubin GPU架构的详细技术规格。作为即将推出的Vera Rubin平台的核心计算单元,这款芯片的看点着实不少。
性能提升:10倍Agentic AI推理吞吐量
从数据来看,在单位能耗下,Vera Rubin NVL72搭配Vera CPU,在Agentic AI推理吞吐量上,相比Blackwell NVL72搭配x86 CPU,最高可以提升10倍。这个数字确实够震撼。
Vera Rubin平台相比Blackwell的10倍智能体推理性能提升
完整的Vera Rubin NVL72机架,由36个Vera CPU和72个Rubin GPU组成。Vera CPU我们之前已经聊过,今天重点看看Rubin GPU。
基础规格:3nm制程、3360亿晶体管
先说基础规格。Rubin GPU采用台积电3nm N3P制程工艺,由两颗计算芯粒组成,通过NVIDIA高速片间互联接口NV-HBI统一封装在一起。
整颗芯片集成3360亿个晶体管,包含224个SM流处理器和896个Tensor Core张量核心,搭载第三代Transformer引擎,可提供最高50 PF的NVFP4推理性能。
显存与互联:HBM4带宽提升2.8倍
显存方面,Rubin集成最高288GB HBM4,共配置8组12-Hi堆叠,峰值带宽达22TB/s,相比Blackwell和Blackwell Ultra提升了2.8倍。这个带宽提升幅度,对于大模型推理来说意义重大。
互联方面,采用多级带宽配置:
- 第六代NVLink:提供3600GB/s扩展带宽,用于GPU间全互联通信。
- NVLink-C2C:提供1800GB/s,用于CPU-GPU一致性通信。
- PCIe Gen6 x16:提供256GB/s的主机连接带宽。
MoE模型优化:TMA描述符管理增强
针对当前主流的MoE(混合专家)模型,Rubin在扩展瓶颈上做了针对性优化。它增强了Tensor Memory Accelerator(TMA),通过优化描述符管理机制,可以更高效地定位和调度专家权重,减少数据搬运开销。
多个内核还可以为共享相同布局的张量保留统一描述符。在运行时,直接通过TMA指令覆盖内存指针和步长等字段,进一步减少元数据管理和数据搬运开销,让更多GPU时间用于实际推理计算。
Tensor Core升级:K维度吞吐量翻倍
另一个核心升级是Tensor Core,每时钟周期的K维度吞吐量翻倍。这意味着更少的循环迭代次数——Blackwell需要4次K迭代的GEMM运算,Rubin只需2次即可完成。循环开销显著降低,Tensor Core利用率也更高。
长上下文注意力加速:稀疏化与自适应压缩
长上下文注意力加速,是Rubin的又一亮点。它将激活稀疏化与自适应压缩结合,把中间数据加载为2:4稀疏格式,仅保存非零数据及对应元数据。
后续的softmax和第二注意力GEMM,都可以基于非零值运算,同时保持最终输出仍为标准Dense格式。这样一来,在不改变模型接口的前提下,计算量和数据搬运都减少了。
此外,Rubin还提升了Softmax及指数运算性能。FP32吞吐达到GB300水平,是GB200的2倍;BF16/FP16吞吐相比GB200提升4倍,相比GB300提升2倍。
内核间依赖调度:瓦片级触发,减少空闲间隙
在内核间依赖调度方面,Rubin实现了比Blackwell更精细的协调。Blackwell启动时,Kernel可以更早开始工作,但仍需等待激活数据可用。
而Rubin支持瓦片级触发,允许后续Kernel在所需输入数据准备完成后,立即提前启动,不必等待更大范围的工作完成,从而有效压缩GPU时间线中的空闲间隙。
GPU间通信:计数写入机制减少同步延迟
GPU间通信方面,Rubin引入了计数写入(Counted Writes)机制,用于设备发起的NVLink通信。传统GPU间数据传输需要额外的协调和同步步骤,计数写入则让接收端GPU能更高效地跟踪传输完成状态,减少同步延迟,使计算不必等待同步操作。
通过计数写入加速NVLink通信,左为Blackwell,右为Rubin
机架级能效管理:功耗降低10%,多部署40% GPU
最后,来看看机架级能效管理。Vera Rubin NVL72将计算、网络、液冷、功率调节和智能功率平滑整合为单一执行域。
系统通过集成储能模块,可吸收GPU瞬时功率波动,平均功耗降低约10%,50毫秒峰值功耗降低约20%。
英伟达还推出了DSX OS操作系统,其中集成了DSX MaxLPS,可统一管理GPU、机柜、液冷系统以及AI工作负载。一个关键点在于,它可以在相同功率预算下,多部署最多40%的GPU。
来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 英伟达Rubin GPU详细架构首曝:性能10倍提升!
- 时间:2026-07-23
-
- 英伟达黄仁勋辟谣Rubin跳票至2028年 明年出货
- 时间:2026-07-13
-
- 数据中心重要突破!英伟达详解Rubin全面液冷技术
- 时间:2026-06-22
-
- NVIDIA宣布两台下代Rubin GPU超算!美国核试验专用
- 时间:2025-10-29
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- iOS 13.5.1电池续航差是电池耗电问题吗
- 时间:2026-07-25
-
- 苹果教育优惠开启 附购买攻略
- 时间:2026-07-25
-
- 苹果iOS 14 beta 2 测试版主要更新内容:除细节变化外修复多项Bug
- 时间:2026-07-25
-
- iOS 14 beta 2 是否解决内存占用过多问题?
- 时间:2026-07-25
-
- 受欢迎的奥特曼游戏有哪些
- 时间:2026-07-25
-
- iOS 14信息应用5大更新变化
- 时间:2026-07-25
-
- iOS 14正式版上线时间公布 官方全新介绍
- 时间:2026-07-25
-
- 最新苹果iOS 14 Beta 2版本更新内容全解析与升级教程
- 时间:2026-07-25








