节省近50%GPU计算!通义百聆开源新一代语音交互模型
时间:2025-12-24 | 作者: | 阅读:012月24日消息,阿里通义百聆家族近日开源新一代语音交互模型Fun-Audio-Chat-8B。
新模型兼具高智商和高情商,具备出色的共情能力,与之对话,仿佛与懂你的人聊天。
在OpenAudioBench、VoiceBench、UltraEval-Audio、MMAU、MMSU、SpeechFunctionCall等权威基准测评中,Fun-Audio-Chat-8B斩获SOTA,超过同量级开源模型。
目前,百聆家族成员包括“会说话”的语音转文字模型Fun-ASR、“听得懂”的文字转语音模型Fun-CosyVoice3。
最新开源的模型Fun-Audio-Chat-8B主打语音对语音功能——“能听会说”。
用户可与模型音频对话,适用于语音聊天、情感陪伴、智能设备和语音客服等多种场景。
无任何情绪标签或提示词情况下,它能通过语义、语气、语速、停顿、重音等细微信号,感知对方的情绪状态,并给出恰到好处的关切、安慰或鼓励式回应。
此外,用户可尝试角色扮演,量身定制语音的情绪、说话风格、语速、高低音和音量等。
而模型能保持“原有智商”,主要得益于两个创新的音频模型训练模式。
一是采用Core-Cocktail两阶段训练策略,先快速学新本事,再把“新本事”和“老底子”融合起来,为了避免学新东西把原来的能力忘掉(灾难性遗忘),第一阶段训练得到的模型和原始的纯文本大模型参数合并后,再进行微调。
二是与人类偏好对齐。通过多阶段和多任务的后训练设计,模型在真实对话场景中能更好地理解用户语音内容与情绪线索,作出更自然、更符合人类期望的回应。
值得注意的是,新模型通过压缩-自回归-解压缩的双分辨率端到端设计,音频帧率降到业界最低的5Hz,在保证语音质量的同时节省近50% GPU计算。
目前,用户可在魔搭社区、HuggingFace和GitHub下载模型自行体验。
来源:https://news.mydrivers.com/1/1094/1094368.htm
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 打破显卡壁垒的低延迟技术:N卡A卡通用优化方案
- 时间:2026-05-18
-
- 黄仁勋回应核武比喻称全球十亿人使用GPU显卡并非导弹
- 时间:2026-05-18
-
- GPUZ查看显卡体质教程:快速检测显卡性能与健康状况
- 时间:2026-05-15
-
- 美国调查英伟达GPU走私案 25亿美元芯片经泰国转运内幕
- 时间:2026-05-09
-
- 国产GPU龙头摩尔线程营收暴涨243%创新高 完成五年五代架构五颗芯片技术迭代
- 时间:2026-04-26
-
- 性能对标RTX 4060!国产自研6nm显卡获微软认可 砺算科技搞定Windows兼容性
- 时间:2026-04-26
-
- 2026国产AI芯片公司Top10出炉!摩尔线程居第二
- 时间:2026-04-02
-
- 惨烈!用户私改液金致RTX 5070报废:核心烧毁、PCB腐蚀
- 时间:2026-03-17
精选合集
更多大家都在玩
大家都在看
更多-
- 从红月开始游戏下载地址分享
- 时间:2026-05-18
-
- 一公顷等于多少平方米土地面积换算详解
- 时间:2026-05-18
-
- iPhone通话录音设置教程与实用技巧详解
- 时间:2026-05-18
-
- 韩剧app哪个最全
- 时间:2026-05-18
-
- 遮天帝路争锋隐藏地图介绍
- 时间:2026-05-18
-
- 史莱姆城堡手游怎么下载
- 时间:2026-05-18
-
- 顶级清醒句句杀疯
- 时间:2026-05-18
-
- 句句胡说句句可爱
- 时间:2026-05-18


