位置:首页 > 综合教程 > 全新英伟达GB300再破世界纪录 256块GPU跑DeepSeek-v3 算力性能提升50%

全新英伟达GB300再破世界纪录 256块GPU跑DeepSeek-v3 算力性能提升50%

时间:2026-07-23  |  作者:318050  |  阅读:0

英伟达GB300刷新世界纪录

7月22日,英伟达放出重磅消息:Blackwell GB300在MoE预训练上刷新世界纪录

只用256块GPU,就跑起了DeepSeek-v3 671B模型。单GPU吞吐量飙到1648 TFLOPs

这个数字意味着什么?对比去年11月的1088 TFLOPs,提升了整整50%。再往前看,上一代GB200只有606 TFLOPs,GB300差不多是它的3倍。

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

系统级优化成果

成绩背后是实打实的苦功。英伟达在过去的6个多月里,模拟了超过25万种配置,从中摸索出38项重大优化方案

累计投入的GPU测试时长高达140万小时。这可不是简单的参数调优,而是系统级别的硬核工程。

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

MoE模型简介

简单科普一下:MoE(混合专家模型)就是把大模型拆成多个专家子网络,每次推理或训练只激活其中一部分。

这样做的好处很明显——用更低的计算成本撑起更大的模型容量。如今已经是主流大语言模型的标准架构。

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

GB300 NVL72的优势

GB300 NVL72的厉害之处在于:用更少的GPU就能达到相同的训练性能。这意味着什么?AI训练成本会进一步下降,对大模型厂商来说,绝对是实实在在的利好。

英伟达也表示,通过系统级优化的持续挖掘,Blackwell架构仍有性能提升空间。这一轮优化成果将直接惠及所有使用GB300的AI训练集群。

对行业的影响

对DeepSeek这类大模型厂商而言,GB300带来的算力跃升直接意味着:

  • 更短的训练周期
  • 更低的成本

单GPU 1648 TFLOPs的算力,足以支撑更大规模模型的快速迭代——这或许才是行业最值得期待的变化。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多