返回快讯列表
开发者动态

FunASR 连发两版,torchaudio 不再是硬依赖,H100 十二并发吞吐升到 11.6 倍实时

FunASR 8 月 26 日和 27 日连发 v1.4.4 与 v1.4.5,torchaudio 改为可选依赖,单张 H100 十二并发下聚合吞吐从 8.431 倍实时提到 11.566 倍,p95 延迟从 19832.9 毫秒降到 414.4 毫秒。

阿里达摩院的语音识别工具包 FunASR 在 8 月 26 日和 27 日连发 v1.4.4 与 v1.4.5。v1.4.5 起 torchaudio 不再是硬依赖,另加了一个可选扩展 funasr[knf],走 kaldi-native-fbank。官方给的昇腾 910B 实测是 70.47 秒音频用时 1.15 秒,实时率 0.016。

v1.4.4 动的是并发。实时 WebSocket 里的进程级全局锁被移除,vLLM 的 decode 请求改成跨会话批处理兼容,同时隔离每个会话的 VAD 状态、共享 encoder 权重。单张 H100 上 12 并发时聚合吞吐从 8.431 倍实时提到 11.566 倍,STOP 的 p95 延迟从 19832.9 毫秒降到 414.4 毫秒。16 并发时吞吐从 8.555 倍提到 13.173 倍。

同期还发了 llama.cpp 运行时 v0.2.1,附 9 个预编译包,覆盖 Linux 的 arm64 与三种 x64 变体、macOS arm64、Windows 的四种变体,每个包带 SHA-256 和 CI 构建记录。Windows CUDA 包只针对 CUDA 架构 86,其他架构要自己编。运行时支持 SenseVoice、Paraformer 和 Fun-ASR-Nano 三个模型,都内置 FSMN-VAD。

这份说明主动写了两条还没修好的。Radeon RX 9070 XT 上后端初始化崩溃仍在调查,Android 和 Mali 不在这次预编译和验证的目标里。识别准确率方面,两个版本的说明都没有给 WER 或 CER,昇腾和 H100 两组测试用的具体模型与音频内容也没有交代。

更多快讯