节省近50%GPU计算!通义百聆开源新一代语音交互模型
时间:2025-12-24 | 作者: | 阅读:012月24日消息,阿里通义百聆家族近日开源新一代语音交互模型Fun-Audio-Chat-8B。
新模型兼具高智商和高情商,具备出色的共情能力,与之对话,仿佛与懂你的人聊天。
在OpenAudioBench、VoiceBench、UltraEval-Audio、MMAU、MMSU、SpeechFunctionCall等权威基准测评中,Fun-Audio-Chat-8B斩获SOTA,超过同量级开源模型。
目前,百聆家族成员包括“会说话”的语音转文字模型Fun-ASR、“听得懂”的文字转语音模型Fun-CosyVoice3。
最新开源的模型Fun-Audio-Chat-8B主打语音对语音功能——“能听会说”。
用户可与模型音频对话,适用于语音聊天、情感陪伴、智能设备和语音客服等多种场景。
无任何情绪标签或提示词情况下,它能通过语义、语气、语速、停顿、重音等细微信号,感知对方的情绪状态,并给出恰到好处的关切、安慰或鼓励式回应。
此外,用户可尝试角色扮演,量身定制语音的情绪、说话风格、语速、高低音和音量等。
而模型能保持“原有智商”,主要得益于两个创新的音频模型训练模式。
一是采用Core-Cocktail两阶段训练策略,先快速学新本事,再把“新本事”和“老底子”融合起来,为了避免学新东西把原来的能力忘掉(灾难性遗忘),第一阶段训练得到的模型和原始的纯文本大模型参数合并后,再进行微调。
二是与人类偏好对齐。通过多阶段和多任务的后训练设计,模型在真实对话场景中能更好地理解用户语音内容与情绪线索,作出更自然、更符合人类期望的回应。
值得注意的是,新模型通过压缩-自回归-解压缩的双分辨率端到端设计,音频帧率降到业界最低的5Hz,在保证语音质量的同时节省近50% GPU计算。
目前,用户可在魔搭社区、HuggingFace和GitHub下载模型自行体验。
来源:https://news.mydrivers.com/1/1094/1094368.htm
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- Safari启用GPU加速方法 提升3D网页渲染性能
- 时间:2026-07-03
-
- 英伟达4600颗最强GPU登陆微软:单卡288GB显存+37TB统一内存池
- 时间:2026-06-30
-
- 元买的RTX 4090竟是塑料核心假卡
- 时间:2026-06-19
-
- 3299元!国产自研显卡砺算LX 7G100今晚第二批售卖依然手慢无 更便宜普通版敬请期待
- 时间:2026-06-18
-
- 壁仞科技宣布:壁砺166首日适配智谱GLM-5.2
- 时间:2026-06-17
-
- 花旗:AMD GPU被严重低估
- 时间:2026-06-15
-
- 挑战GPU独大格局!谷歌自研TPU冲刺3500万颗:成本比GPU低30%以上
- 时间:2026-06-08
-
- 富士康展示液冷版RTX Pro 6000服务器GPU
- 时间:2026-06-08
精选合集
更多大家都在玩
大家都在看
更多-
- 高考志愿填报模板完整版附表格填写示例
- 时间:2026-07-04
-
- 2026好玩的挂机手游推荐
- 时间:2026-07-04
-
- 高考志愿填报规划师职业前景与报考指南
- 时间:2026-07-04
-
- 高考志愿填报实用指导与技巧
- 时间:2026-07-04
-
- 高考志愿填报时间安排
- 时间:2026-07-04
-
- 高考志愿填报系统使用技巧与注意事项
- 时间:2026-07-04
-
- 高考志愿填报模拟系统指南
- 时间:2026-07-04
-
- 高考志愿填报方法与技巧详解
- 时间:2026-07-04


