位置:首页 > 产业资讯 > Fish Audio 周年发布 S2.1Pro 实时对话语音模型支持耳语与情绪控制

Fish Audio 周年发布 S2.1Pro 实时对话语音模型支持耳语与情绪控制

时间:2026-08-13  |  作者:宇宙开黑者  |  阅读:0

先说几个关键点:Fish Audio 在成立周年之际,正式推出了 S2.1Pro——这是他们目前最顶级的语音大模型,专为实时对话场景设计,而不是传统的脚本旁白工具。目前该模型已通过 Fish Audio API 上线,同时提供合理限额的免费版本,方便开发者和测试人员上手体验。

QQ20260729-143606.jpg

技术层面,S2.1Pro 的首帧音频延迟只有大约 90 毫秒,这意味着对话轮替可以做到几乎无感衔接,自然流畅。它覆盖了 83 种语言,并且采用统一的语音识别架构,跨语言一致性表现不错。更值得关注的是语音控制的灵活性——不再局限于预设的情绪菜单,而是允许直接在文本中嵌入自由格式的括号标签,比如“(耳语)”“(紧张笑声)”这类行内细粒度指令,精准度相当高。

另一个亮点是原生支持多说话人对话生成,只需要 10 到 30 秒的短参考样本,就能完成高质量语音克隆,而且无需额外微调,就能精准复刻目标语调与说话风格。这在实际部署中能省下不少功夫。

从行业视角来看,S2.1Pro 的发布标志着语音 AI 正在从传统的脚本式合成,加速向极低延迟、高拟真度的实时对话模式演进。对于全球化智能语音交互落地来说,这无疑降低了算力门槛,提供了更可用的基础设施。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多