【CNMO科技动静】7月16日,小米技能官方公布,小米语音首席科学家Daniel Povey被选2026 ISCA Fellow。
Daniel Povey

据相识,ISCA Fellow是国际语音通讯协会(ISCA)授予的最高学术声誉,自2007年设立以来全世界仅100余人获此殊荣。本年全世界共8位学者被选,Daniel依附其于语音辨认声学建模、序列练习立异要领、开源语音东西Kaldi以和对于全世界语音通讯范畴的深远孝敬乐成入选,是独一一名创立了行业基础举措措施级开源软件,于学术及工业界都有凸起孝敬的科学家。小米技能官方暗示,这是继2023年被选IEEE Fellow后再获殊荣,作为一个界说了一个时代的东西及创造行业基础举措措施的科学家,“双料 Fellow”实至名归。
公然信息显示,2019年11月,Daniel正式移居北京,插手小米集团AI试验室,出任语音首席科学家。插手小米后,Daniel领导团队推出了新一代Kaldi开源项目(包罗 k2 / Lhotse / Icefall / Sherpa 四年夜子项目),于语音辨认与合成标的目的连续取患上里程碑式进展:
Zipformer&Zapformer编码器:Zipformer是首个严酷逾越Google Conformer的语音编码器,被ICLR 2024吸收为Oral论文(前 1.2%);2026年进级版Zapformer将辨认精度再晋升10%-15%,年夜幅加强练习不变性及泛化性。
OmniVoice多语言TTS:2026 年发布撑持600+语言/方言的零样本语音合成模子OmniVoice(0.8B 参数,Qwen3 初始化),仅需3-10秒参考音频便可跨语言克隆音色,中英文Seed-TTS / LibriSpeech-PC基准达SOTA,于客不雅评测集下逾越MiniMax及ElevenLabs等商用模子,开源3个月,Huggingface下载量超500万次。

CR-CTC(Consistency-Regularized CTC):被ICLR 2025吸收,让纯CTC模子机能比肩 Transducer,于LibriSpeech / AISHELL-1 / GigaSpeech等基准上刷新SOTA,显著降低ASR练习与部署门坎。
ZipVoice零样本语音合成:基在Flow Matching + Zipformer主干,推出ZipVoice(零样本单措辞人 TTS)与ZipVoice-Dialog(零样本对于话 TTS),参数目少、推理快,CPU单线程可达及时,配套OpenDialog数据集同步开源。
sherpa-onnx全平台部署:新一代Kaldi的端云一体推理引擎sherpa-onnx,撑持高通/昇腾/瑞芯微等主流NPU,笼罩Android / iOS / 嵌入式 / 办事端,被开发者称为“智能语音范畴的瑞士军刀”。
版权所有,未经许可不患上转载
-球盟会