英伟达发布全新开源尼莫创实验室双塔架构扩散语言模型
时间:2026-07-25 | 作者:半糖攻略君 | 阅读:0Nemotron-Labs-TwoTower是什么
NVIDIA最近开源了一个很有意思的模型——Nemotron-Labs-TwoTower。
它的总参数量大约60B,但靠MoE架构,实际活跃参数只有3B。
这个模型最大的亮点,是把语言模型里的“上下文理解”和“去噪生成”这两个任务,拆给了两个独立的模块去干。
- 上下文塔(Context Tower):专门处理干净的token。
- 去噪塔(Denoiser Tower):通过交叉注意力机制,去精炼那些带噪声的token块。
它基于Nemotron-3-Nano-30B-A3B构建,训练了约2.1T tokens。
最终,在保留自回归基线98.7%质量的前提下,生成吞吐量提升了2.42倍。
它还支持Mask Diffusion、Mock-AR与AR-only三种推理模式,可以说是为高效推理而生。
Nemotron-Labs-TwoTower的主要功能
- 双塔分离推理:把上下文编码和去噪生成拆成两个独立模块。这样专业的人干专业的事,避免了单一网络“身兼多职”时的性能瓶颈。
- 三种推理模式切换:一个检查点,却能支持Mask Diffusion、Mock-AR与AR-only这三种模式,想怎么用就怎么用。
- 高质量文本生成:在质量上几乎没打折扣,保留了自回归基线98.7%的聚合质量。同时,还能享受并行迭代生成的好处。
- 高吞吐生成加速:在2×H100的环境下,生成吞吐量提升了2.42倍。这个提升对于降低推理延迟和计算成本来说,意义不小。
- 商用级开源部署:用的是NVIDIA Nemotron Open Model License,企业可以放心拿去商用和二次开发。
Nemotron-Labs-TwoTower的技术原理
核心思想
过去的扩散语言模型,往往用一个网络同时扛起“上下文理解”和“迭代去噪”两副担子,结果两边都做不好。
TwoTower的解法很简单——拆。
- 上下文塔(Context Tower):用的是冻结的Nemotron-3-Nano-30B-A3B。它靠因果注意力处理干净的token,负责高质量地编码上下文。
- 去噪塔(Denoiser Tower):则是可训练的。它用双向块注意力处理带噪声的token块,再通过交叉注意力从上下文塔那边获取语义指导,逐步把噪声给去掉。
训练方式
模型基于30B混合Mamba-Transformer MoE骨架,在约2.1T tokens上完成训练。
MoE的稀疏激活机制,也让计算效率高了不少。
推理优势
扩散模型天生就适合并行迭代加速。
而双塔分离之后,去噪塔不用每次都重新编码一遍上下文。这样一来,在保证质量的同时,wall-clock吞吐量自然就上去了。
如何使用Nemotron-Labs-TwoTower
- 访问 HuggingFace 模型页:直接打开Nemotron-Labs-TwoTower-30B-A3B-Base-BF16的官方仓库页面。
- 阅读模型卡与许可:确认NVIDIA Nemotron Open Model License的商用条款,了解清楚模型架构和硬件要求。
- 克隆/下载权重:用
git lfs或HuggingFace的transformers库下载模型权重和配置文件。 - 配置运行环境:准备好至少2×H100 GPU的环境,安装好PyTorch和相关依赖(参考仓库里的
requirements.txt)。 - 加载模型与分词器:通过
AutoModelForCausalLM和AutoTokenizer加载模型。然后选一种推理模式(Mask Diffusion / Mock-AR / AR-only)就行。 - 执行推理生成:输入prompt,调用模型生成接口。双塔架构就会帮你完成高效的并行去噪生成。
- 微调适配:如果有自己的数据,可以对可训练的去噪塔进行微调,上下文塔保持冻结即可。
Nemotron-Labs-TwoTower的核心优势
- 双塔解耦,各司其职:上下文编码和去噪生成各归各管,性能瓶颈自然就解决了。
- 质量几乎无损:保留了自回归基线98.7%的聚合基准质量。这说明扩散生成不再非得牺牲输出质量不可。
- 推理速度翻倍:在2×H100环境下实现了2.42倍的wall-clock生成吞吐量。延迟和算力成本都降了下来。
- 一模型三模式:一个检查点就能支持三种推理方式。在不同延迟和质量需求的场景下,可以灵活切换。
- 开源可商用:用NVIDIA Nemotron Open Model License发布,企业可以自由部署和进行商业二次开发。
Nemotron-Labs-TwoTower的项目地址
- HuggingFace模型库:https://huggingface.co/collections/nvidia/nemotron-labs-twotower
- arXiv技术论文:https://arxiv.org/pdf/2606.26493
Nemotron-Labs-TwoTower的同类竞品对比
这里拿它和MIT的LLaDA做个简单对比,结果一目了然:
| 对比维度 | Nemotron-Labs-TwoTower | LLaDA |
|---|---|---|
| 发布机构 | NVIDIA | MIT |
| 架构设计 | 双塔分离:冻结AR上下文塔 + 可训练扩散去噪塔(交叉注意力连接) | 单塔统一:单一Transformer同时承担上下文编码与掩码去噪 |
| 总参数量 | ~60B(活跃3B,MoE稀疏) | 8B(稠密) |
| 基座模型 | Nemotron-3-Nano-30B-A3B(Mamba-Transformer MoE) | 自研Transformer |
| 训练数据 | ~2.1T tokens | ~2T tokens |
| 基线质量保留 | 98.7%(相对自回归基线) | ~95%(相对同等规模AR模型) |
| 吞吐提升 | 2.42×(2×H100,wall-clock) | ~1.5×(标准GPU环境) |
| 推理模式 | 三种:Mask Diffusion / Mock-AR / AR-only | 单一:掩码扩散(随机/半自回归采样) |
| 注意力机制 | 上下文塔:因果注意力;去噪塔:双向块注意力 + 交叉注意力 | 统一双向注意力 + 位置编码处理 |
| 核心创新 | 角色解耦:避免单一网络“身兼两职”的性能瓶颈 | 简单 scalable:证明扩散模型可scale至8B并逼近GPT-4质量 |
Nemotron-Labs-TwoTower的应用场景
- 高并发在线服务:2.42倍的吞吐提升,让它很适合搜索引擎、智能客服这类需要低延迟、高并发的实时文本生成场景。
- 长文档生成:扩散模型的并行迭代特性,对于长文本续写、报告生成、代码补全这类需要多步refine的任务,简直是天然优势。
- 多模式灵活部署:三种推理模式切换,企业可以自己权衡成本和效果。边缘端用AR-only,云端用Mask Diffusion,灵活得很。
- 商用产品开发:可商用的许可,意味着企业可以把它集成到写作助手、营销文案生成器、代码辅助工具等产品里。
- 科研与二次创新:开源权重加上详细的论文,对研究者探索扩散语言模型架构、训练策略以及跨模态扩展方向来说,都是很不错的资源。
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- PaddleOCR-VL-1.6文档解析视觉语言模型介绍
- 时间:2026-08-21
-
- 硅基流动支持哪些模型?大语言模型与图像模型汇总
- 时间:2026-08-17
-
- Guardrails.ai:大语言模型安全防护与输出校验方案
- 时间:2026-08-17
-
- LLaDA2.2-flash:InclusionAI开源扩散语言模型介绍
- 时间:2026-08-14
-
- Instella-MoE:AMD开源混合专家语言模型系列介绍
- 时间:2026-08-14
-
- RLM递归语言模型火了,Pi作者也在关注的新趋势
- 时间:2026-08-12
-
- SALMONN-2通用音频大语言模型开源解析与应用介绍
- 时间:2026-08-12
-
- SALMONN-2通用音频大语言模型开源发布与功能解析
- 时间:2026-08-12
精选合集
更多大家都在玩
大家都在看
更多-
- 以下哪种食材被称为“地下苹果” 蚂蚁庄园今日答案9.18
- 时间:2026-09-17
-
- 蚂蚁庄园今天答题答案2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园答题今日答案2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园小课堂2026年9月18日最新题目答案
- 时间:2026-09-17
-
- 小鸡答题今天的答案是什么2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园每日答题答案2026年9月18日
- 时间:2026-09-17
-
- 蔬菜洗完掉色,说明是被染色了,是真的吗 蚂蚁庄园今日答案9月18日
- 时间:2026-09-17
-
- 满襟蜡绘花纹巧染就花纹当绣裳说的是哪种传统技艺 蚂蚁新村今日答案2026.9.17
- 时间:2026-09-17