位置:首页 > 产业资讯 > 腾讯混元发布MMAE音频编辑基准:AI精准编辑能力不足5%

腾讯混元发布MMAE音频编辑基准:AI精准编辑能力不足5%

时间:2026-08-18  |  作者:宇宙开黑者  |  阅读:0

音频生成AI已经能做出不少让人眼前一亮的东西,但说到“编辑”一段现有的音频——比如改个词、调个节奏、换种音色——情况就复杂多了。

最近,腾讯混元联合上海交通大学、新加坡南洋理工大学、天津大学、北京大学、复旦大学等多家顶尖机构,推出了一个名为MMAE(Massive Multitask Audio Editing Benchmark)的基准测试集。

这是第一个专门针对通用指令驱动音频编辑的大规模评估标准。说白了,它给AI音频编辑能力画了一条清晰的标尺。

而测试结果也毫不客气地揭露了当前技术的一大短板:精准修改,远没想象中容易。

从“生成”到“编辑”:AI音频能力的真正考验

大多数人熟悉的AI音频,是从文本或提示生成一段新声音。但MMAE的玩法不一样。

它要求模型先理解一段已有的音频,再根据一句自然语言指令进行精准修改。该改的改,不该改的一丝不动。

这种“编辑而非重构”的能力,对保真度、指令跟随和上下文理解提出了更高要求,也更接近真实应用场景。

  • 比如播客后期抠掉一个口误
  • 音乐混音里单独调整某一声轨
  • 为某个角色定制个性化语音

测试结果有点扎心:当前主流模型的精确匹配率(Exact Match Rate,简称EMR)普遍低于5%。

这意味着,让AI改个音频,十有八九会出现以下问题:

  • 过度修改
  • 遗漏指令
  • 破坏原始音质

可靠且可控的音频编辑,仍然是块硬骨头。

MMAE基准亮点:覆盖真实场景的多维度评估

MMAE的设计相当扎实,几个核心要素就能看出一二:

  • 2000个高保真样本,全部来自真实世界场景,不是实验室里造出来的数据。
  • 17741项细粒度评估指标,相当于给每个模型出具一份详细的成绩单,量化到每一处改动。
  • 7种模态设置,覆盖声音、音乐、语音以及它们的混合形式,复杂音频环境也能测。
  • 6级任务复杂度,从基础修改一路升级到多跳推理和多轮编辑,看看模型到底能扛到哪一关。
  • 8种操作类型,支持局部和全局不同粒度的编辑,考验模型的精细控制能力。

为什么这套基准重要

这套基准不仅是技术评估工具,更是整个音频AI从“生成式”向“编辑式”转型的重要里程碑。

它为研究者和开发者提供了统一的度量尺,有望加速下一代音频编辑模型的迭代。

未来展望:音频编辑或成AI多模态核心竞争力

随着多模态大模型的发展,精准音频编辑在内容创作、影视后期、无障碍辅助等领域的价值会越来越凸显。

腾讯混元这次联合多家高校,展现了中国AI研究在音频方向的先发布局。

业界期待更多开源资源和后续模型跟上,一起把这块技术空白填上。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多