节省近50%GPU计算!通义百聆开源新一代语音交互模型
时间:2025-12-24 | 作者: | 阅读:012月24日消息,阿里通义百聆家族近日开源新一代语音交互模型Fun-Audio-Chat-8B。
新模型兼具高智商和高情商,具备出色的共情能力,与之对话,仿佛与懂你的人聊天。
在OpenAudioBench、VoiceBench、UltraEval-Audio、MMAU、MMSU、SpeechFunctionCall等权威基准测评中,Fun-Audio-Chat-8B斩获SOTA,超过同量级开源模型。
目前,百聆家族成员包括“会说话”的语音转文字模型Fun-ASR、“听得懂”的文字转语音模型Fun-CosyVoice3。
最新开源的模型Fun-Audio-Chat-8B主打语音对语音功能——“能听会说”。
用户可与模型音频对话,适用于语音聊天、情感陪伴、智能设备和语音客服等多种场景。
无任何情绪标签或提示词情况下,它能通过语义、语气、语速、停顿、重音等细微信号,感知对方的情绪状态,并给出恰到好处的关切、安慰或鼓励式回应。
此外,用户可尝试角色扮演,量身定制语音的情绪、说话风格、语速、高低音和音量等。
而模型能保持“原有智商”,主要得益于两个创新的音频模型训练模式。
一是采用Core-Cocktail两阶段训练策略,先快速学新本事,再把“新本事”和“老底子”融合起来,为了避免学新东西把原来的能力忘掉(灾难性遗忘),第一阶段训练得到的模型和原始的纯文本大模型参数合并后,再进行微调。
二是与人类偏好对齐。通过多阶段和多任务的后训练设计,模型在真实对话场景中能更好地理解用户语音内容与情绪线索,作出更自然、更符合人类期望的回应。
值得注意的是,新模型通过压缩-自回归-解压缩的双分辨率端到端设计,音频帧率降到业界最低的5Hz,在保证语音质量的同时节省近50% GPU计算。
目前,用户可在魔搭社区、HuggingFace和GitHub下载模型自行体验。
来源:https://news.mydrivers.com/1/1094/1094368.htm
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 挑战GPU独大格局!谷歌自研TPU冲刺3500万颗:成本比GPU低30%以上
- 时间:2026-06-08
-
- 富士康展示液冷版RTX Pro 6000服务器GPU
- 时间:2026-06-08
-
- GPU-Z查看显卡实时功耗及传感器监控设置方法
- 时间:2026-05-30
-
- HBM内存技术革新:分离式封装与光互联突破GPU性能瓶颈
- 时间:2026-05-25
-
- 革命性突破!HBM告别GPU贴身设计:分离封装+光互联打破内存墙
- 时间:2026-05-25
-
- 国产显卡LX 7G100游戏性能实测:18款游戏对比RTX 3060表现如何
- 时间:2026-05-23
-
- GPU-Z无法检测显卡体质解决方法
- 时间:2026-05-23
-
- GPU-Z检测显卡体质教程:如何查看与解读体质分数
- 时间:2026-05-22
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- 万神殿战略城市建造游戏《Theos: Cities of Myth》将于今年登陆PC平台
- 时间:2026-06-08
-
- 上帝模拟游戏《Ornelia》将以抢先体验的形式登陆PC平台
- 时间:2026-06-08
-
- 美间导入酷家乐户型图矢量文件详细教程
- 时间:2026-06-08
-
- 美间家居海报制作全攻略 快速上手技巧分享
- 时间:2026-06-08
-
- 日语配音秀App核心功能全面解析与使用指南
- 时间:2026-06-08
-
- 单人僵尸撤离类游戏《Pale Tide》将登陆PC平台
- 时间:2026-06-08
-
- 蚂蚁庄园今日答案最新6.9 6月9日庄园每日答题答案
- 时间:2026-06-08
-
- 美间智能排版软件使用教程与操作指南
- 时间:2026-06-08


