腾讯混元发布MMAE音频编辑基准:AI精准编辑能力不足5%
时间:2026-08-18 | 作者:宇宙开黑者 | 阅读:0音频生成AI已经能做出不少让人眼前一亮的东西,但说到“编辑”一段现有的音频——比如改个词、调个节奏、换种音色——情况就复杂多了。
最近,腾讯混元联合上海交通大学、新加坡南洋理工大学、天津大学、北京大学、复旦大学等多家顶尖机构,推出了一个名为MMAE(Massive Multitask Audio Editing Benchmark)的基准测试集。
这是第一个专门针对通用指令驱动音频编辑的大规模评估标准。说白了,它给AI音频编辑能力画了一条清晰的标尺。
而测试结果也毫不客气地揭露了当前技术的一大短板:精准修改,远没想象中容易。
从“生成”到“编辑”:AI音频能力的真正考验
大多数人熟悉的AI音频,是从文本或提示生成一段新声音。但MMAE的玩法不一样。
它要求模型先理解一段已有的音频,再根据一句自然语言指令进行精准修改。该改的改,不该改的一丝不动。
这种“编辑而非重构”的能力,对保真度、指令跟随和上下文理解提出了更高要求,也更接近真实应用场景。
- 比如播客后期抠掉一个口误
- 音乐混音里单独调整某一声轨
- 为某个角色定制个性化语音
测试结果有点扎心:当前主流模型的精确匹配率(Exact Match Rate,简称EMR)普遍低于5%。
这意味着,让AI改个音频,十有八九会出现以下问题:
- 过度修改
- 遗漏指令
- 破坏原始音质
可靠且可控的音频编辑,仍然是块硬骨头。
MMAE基准亮点:覆盖真实场景的多维度评估
MMAE的设计相当扎实,几个核心要素就能看出一二:
- 2000个高保真样本,全部来自真实世界场景,不是实验室里造出来的数据。
- 17741项细粒度评估指标,相当于给每个模型出具一份详细的成绩单,量化到每一处改动。
- 7种模态设置,覆盖声音、音乐、语音以及它们的混合形式,复杂音频环境也能测。
- 6级任务复杂度,从基础修改一路升级到多跳推理和多轮编辑,看看模型到底能扛到哪一关。
- 8种操作类型,支持局部和全局不同粒度的编辑,考验模型的精细控制能力。
为什么这套基准重要
这套基准不仅是技术评估工具,更是整个音频AI从“生成式”向“编辑式”转型的重要里程碑。
它为研究者和开发者提供了统一的度量尺,有望加速下一代音频编辑模型的迭代。
未来展望:音频编辑或成AI多模态核心竞争力
随着多模态大模型的发展,精准音频编辑在内容创作、影视后期、无障碍辅助等领域的价值会越来越凸显。
腾讯混元这次联合多家高校,展现了中国AI研究在音频方向的先发布局。
业界期待更多开源资源和后续模型跟上,一起把这块技术空白填上。
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- PlanningBench:开源大模型规划能力评测框架介绍
- 时间:2026-08-21
-
- MMAE音频编辑评测基准:腾讯混元联合高校推出新标准
- 时间:2026-08-17
-
- E-Bench:腾讯混元等推出的智能体评测基准
- 时间:2026-08-13
-
- AngelSpec端到端推测解码训练框架解析与腾讯混元开源介绍
- 时间:2026-08-13
-
- 腾讯混元Hy ASR 3.0预览版发布,语音识别能力全面升级
- 时间:2026-08-12
-
- 腾讯混元团队发布E-Bench多步骤智能体评测基准平台
- 时间:2026-08-05
-
- 腾讯混元推出Hy ASR 3.0预览版新一代语音识别模型
- 时间:2026-08-05
-
- 腾讯混元Hy ASR 3.0预览新一代语音识别模型
- 时间:2026-08-05
精选合集
更多大家都在玩
大家都在看
更多-
- 糖尿病完全不能吃糖吗
- 时间:2026-09-15
-
- 蚂蚁庄园小课堂2026年9月16日最新题目答案
- 时间:2026-09-15
-
- 小鸡答题今天的答案是什么2026年9月16日
- 时间:2026-09-15
-
- 蚂蚁庄园每日答题答案2026年9月16日
- 时间:2026-09-15
-
- 以下哪种粮食是酿造绍兴黄酒的主要原料 蚂蚁庄园今日答案9月16日
- 时间:2026-09-15
-
- 劝学名句“及时当勉励,岁月不待人”出自哪位诗人 蚂蚁庄园今日答案9.16
- 时间:2026-09-15
-
- 蚂蚁庄园今天答题答案2026年9月16日
- 时间:2026-09-15
-
- 蚂蚁庄园答题今日答案2026年9月16日
- 时间:2026-09-15