位置:首页 > 热点资讯 > 小米语音首席科学家Povey当选2026ISCA Fellow全球仅百余人

小米语音首席科学家Povey当选2026ISCA Fellow全球仅百余人

时间:2026-07-19  |  作者:318050  |  阅读:0

7月16日,小米技术官方账号发布消息:小米语音首席科学家Daniel Povey成功当选2026年度ISCA Fellow。

ISCA Fellow是国际语音通信协会(ISCA)授予的最高学术荣誉。自2007年设立以来,全球仅有100多人获此殊荣。

小米语音首席科学家 Daniel Povey 当选 2026 ISCA Fellow,全球仅 100 余人获此殊荣

什么是ISCA Fellow?

ISCA Fellow是语音通信领域学术界的顶尖认可。2026年,全球共有8位学者当选。

Daniel凭借在语音识别声学建模、序列训练方法上的创新,以及开源语音工具Kaldi的深远影响,成功拿下这一席位。

更值得一提的是:他是这8位学者中唯一一位亲手创建了行业基础设施级开源软件的科学家。他在学术和工业界都有极其突出的贡献。

“双料Fellow”实至名归

这是Daniel继2023年当选IEEE Fellow之后的又一项重磅荣誉。作为一个定义了一个时代的工具,以及创造行业基础设施的科学家,Daniel的“双料Fellow”头衔确实实至名归。

职业生涯:从剑桥到小米

Daniel的职业生涯起步于剑桥大学。他2003年在那里拿到博士学位,随后进入工业界。

他先后在IBM T.J. Watson研究中心和微软研究院工作了大约十年,深耕语音识别核心技术。

2019年11月,他移居北京,加入小米集团AI实验室,出任语音首席科学家。

加入小米后的核心成果

加入小米后,Daniel带领团队推出了新一代Kaldi开源项目,旗下包含k2、Lhotse、Icefall、Sherpa四大子项目。在语音识别与合成方向持续取得里程碑式进展:

  • Zipformer & Zapformer 编码器:Zipformer是首个严格超越Google Conformer的语音编码器,被ICLR 2024接收为Oral论文,属于前1.2%的顶尖作品。2026年升级版Zapformer,把识别精度再拉高了10%-15%,训练稳定性和泛化性也明显增强。

  • OmniVoice 多语言 TTS:2026年发布的OmniVoice,是一个支持600多种语言和方言的零样本语音合成模型,参数量仅0.8B,基于Qwen3初始化。只需3到10秒的参考音频,就能跨语言克隆音色。在中英文Seed-TTS和LibriSpeech-PC基准上达到SOTA,客观评测中甚至超越了MiniMax和ElevenLabs等商用模型。开源仅3个月,Huggingface下载量已突破500万次。

  • CR-CTC(Consistency-Regularized CTC):这项成果被ICLR 2025接收,它让纯CTC模型的性能比肩Transducer,在LibriSpeech、AISHELL-1、GigaSpeech等基准上刷新了SOTA。这大大降低了ASR的训练与部署门槛。

  • ZipVoice 零样本语音合成:基于Flow Matching和Zipformer骨干,推出了ZipVoice(零样本单说话人TTS)和ZipVoice-Dialog(零样本对话TTS)。参数量少、推理速度快,在CPU单线程上就能达到实时效果。配套的OpenDialog数据集也同步开源。

  • sherpa-onnx 全平台部署:新一代Kaldi的端云一体推理引擎sherpa-onnx,支持高通、昇腾、瑞芯微等主流NPU,覆盖Android、iOS、嵌入式和服务端。被开发者们称为“智能语音领域的瑞士军刀”。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多