返回快讯列表
开源生态

Hugging Face 量化 ASR 刷榜,11 个开源模型被验出复述参考文本

Hugging Face 8 月 21 日发布 ASR benchmark optimization 研究,在 VoxPopuli 与 LibriSpeech 上用三种探针检验 11 个开源语音识别模型。

Hugging Face 在 8 月 21 日发了一篇语音识别 benchmark optimization 研究,作者来自 HumeAI 等多家。对象是 11 个常用开源 ASR 模型,数据集是 VoxPopuli English 和 LibriSpeech。

他们用了三种探针。第一种是 consensus 和 reference 的 disagreement,用低 phoneme error rate 的模型组 ensemble,标出「所有模型一致不同意参考转写」的样本,再抽样人工核对。

一个典型例子。某段 VoxPopuli 音频里清楚有 "Thank you, Mr. President",参考转写漏了 "Thank you"。11 个模型里 6 个跟着漏。换成同一说话人的语音克隆,降到 5 个。换成训练截止之后录的新议会发言人克隆,只剩 1 个还在漏,是 microsoft/Phi-4-multimodal-instruct。用无关的通用 TTS 音色重合成同一句话时,11 个模型全部恢复出被漏掉的 "Thank you"。作者的判断是,模型在靠声学线索识别「这是哪个 benchmark」。

第二种探针是 Masked Entity Retrieval,把音频里的数字静音后再让模型转写。在 LibriSpeech 上,部分基准分数最高的模型仍在大约 30% 到 40% 的样本里补出了被删掉的数字,有的还会自动补出被静音的年份,并把「one thousand six hundred」写成参考转写里的错误值 "1"。

被点名的模型包括 CohereLabs/cohere-transcribe-03-2026、nvidia/canary-qwen-2.5b、ibm-granite/granite-speech-4.1-2b、microsoft/Phi-4-multimodal-instruct、nvidia/parakeet-tdt-0.6b-v2、bosonai/higgs-audio-v3-8b-stt-v2、Qwen/Qwen3-ASR-0.6B-hf、mistralai/Voxtral-Mini-3B-2507、moonshotai/Kimi-Audio-7B-Instruct、openai/whisper-large-v3、moonshine-ai/moonshine-streaming-medium。

更多快讯