位置:首页 > 产业资讯 > 英伟达推出统一音频智能模型Nemotron-30B

英伟达推出统一音频智能模型Nemotron-30B

时间:2026-07-22  |  作者:318050  |  阅读:0

音频处理短板,多模态模型的新挑战

在多模态大模型飞速迭代的今天,音频处理能力往往成了那个被“牺牲”的短板。不少模型在提升音频理解的同时,反倒把文本逻辑能力给拖累了。

最近,NVIDIA 研究团队正式放出了一款叫做 Nemotron-Labs-Audex-30B-A3B(简称 Audex)的统一音频-文本大语言模型,目标就是破解这个技术难题。

Audex 设计思路:简洁高效的深度融合

Audex 的设计思路相当简洁高效。它基于强大的纯文本 MoE(混合专家模型)架构,用一个 Transformer 解码器就把文本和量化音频 token 统一处理了。

这样一来,音频输入能顺畅地投影到文本嵌入空间。同时,模型在处理多模态任务时还能跟现有的 LLM 基础设施无缝对接——真正意义上的深度融合,不是那种硬拼凑的。

海量数据与多阶段训练

为了练好这个模型,研究团队攒了海量数据:1574 亿音频 token 加上 3205 亿文本 token。经过多阶段监督训练、纯文本 Cascade RL(强化学习),再加多域在策略知识蒸馏,Audex 在各项指标上都拿出了亮眼的表现。

在音频理解、语音识别、翻译、音频生成这些任务上,Audex 做到了行业领先。更难能可贵的是,它几乎完整保留了原版 LLM 在推理、对齐、知识储备和长文本处理上的核心能力,性能下降微乎其微。

开源价值:从研究 Demo 到可用工具

作为一款开源模型,Audex 的发布对整个语音技术行业来说是个实实在在的好消息。它不再只是论文里演示的研究 Demo,而是开发者可以直接评估、部署的成熟工具。

对那些需要处理复杂音频交互的产品开发者而言,Audex 提供了一种兼顾性能与功能的新选择,也为未来的多模态智能体研究打开了一扇新的大门。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多