位置:首页 > 综合教程 > NVIDIA首日支持谷歌DiffusionGemma 150tokens/s全系可用

NVIDIA首日支持谷歌DiffusionGemma 150tokens/s全系可用

时间:2026-08-14  |  作者:实验室老王  |  阅读:0

NVIDIA为谷歌DiffusionGemma提供首日支持

6月11日,NVIDIA宣布了一项值得关注的动作——为谷歌DeepMind最新发布的开放模型DiffusionGemma提供首日支持。

该支持覆盖GeForce RTX GPU、RTX PRO平台以及DGX系统全系列。这意味着,从消费级显卡到专业工作站,再到数据中心级别的DGX集群,几乎全线NVIDIA硬件都能第一时间跑起这个新模型。

模型核心特点:文本扩散,速度提升4倍

DiffusionGemma基于Gemma 4架构,总参数25.2亿。但推理时仅需激活3.8亿参数,支持256K上下文长度,并针对NVIDIA硬件做了深度优化。

关键区别:它不是传统的自回归模型,而是一个文本扩散模型

  • 传统自回归模型:一个字一个字向外蹦。
  • DiffusionGemma:每步可以并行去噪256个tokens。

借助NVIDIA GPU的并行计算能力,速度提升约4倍

150 tokens/s!NVIDIA为谷歌DiffusionGemma提供首日支持:RTX/DGX全系可用

性能数据:无需调优即可获得优异表现

NVIDIA通过Tensor Core架构和CUDA软件栈的协同优化,实现了无需额外调优即可获得优异性能。

具体数据:

  • 单块H100 GPU:每秒1000个token
  • DGX Spark:每秒150个token

这个速度,对于文本生成任务来说,相当可观。

精度格式与开源部署

模型支持BF16NVFP4两种精度格式。开发者可以直接通过Hugging Face Transformers在RTX 5090或DGX Spark上快速做原型验证。

如果进入生产环境,则可以使用vLLM进行部署。

值得注意的是,DiffusionGemma采用Apache 2.0许可证开源,支持文本与图像多模态输入,并且可以完全运行于本地RTX或DGX平台——无需联网、无需按token付费。这对注重数据隐私和成本控制的团队来说,吸引力不小。

当前支持平台与获取方式

目前,该模型已经在以下主流框架中获得初始支持:

  • Hugging Face Transformers
  • vLLM
  • Unsloth

对于不同用户,推荐如下:

  • Windows开发者:如果手头有一块RTX 5090,现在就可以下载体验。
  • 专业级用户:可以选用RTX PRO 6000工作站或DGX Station来完成更大规模的部署和微调任务。

150 tokens/s!NVIDIA为谷歌DiffusionGemma提供首日支持:RTX/DGX全系可用

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多