IBM 8 月 25 日在 Hugging Face 上发了两个英文语音识别模型,granite-speech-5.0-470m-turboctc 走 Apache 2.0,granite-speech-5.0-470m-turboctc-nc 走 CC-BY-NC-SA-4.0,参数都是 4.7 亿。
结构上换了路子。上一代是声学编码器加投影层再接一个带 LoRA 的 Granite 语言模型,这一代砍成纯编码器,16 个 Conformer 块,第 8 块之后做自条件,配 chunkwise attention 和 CTC 损失。前端每秒 100 帧的 log-Mel 经三级二倍下采样降到每秒 12.5 个 token,第一级用 reshape 堆叠特征向量,后两级是前两个 Conformer 块里的带步长卷积。
代价是丢掉了依赖语言模型的能力,语音翻译和关键词偏置都没了。换来的是吞吐比上一代 Granite Speech 快 20 倍以上,体积也更小,IBM 把它定位到边缘端的语音转文字。
成绩方面,截至 8 月 25 日的 OpenASR 英文短音频公开榜上,非商用版聚合词错率 4.85%,Apache 版 5.00%。吞吐在单张 NVIDIA H200 上超过 12600 RTFx,按官方说法是批量推理时一秒处理三个半小时以上的语音。远场的 FFASR 榜上,Apache 版准确率排第 9、非商用版排第 5,两个都是榜上最快的。
训练数据两版共用 MLS 44600 小时、YODAS 8900 小时、CommonVoice-17 2500 小时等公开语料,另有用 StyleTTS2 配音的合成集。非商用版额外加了 GigaSpeech 一万小时和 SPGI Speech 4900 小时,这也是两个许可证不同的原因。