Cactus 发布了体积 16.9 MB 的语音识别模型 Whistle,面向手机、可穿戴设备、机器人和智能家居。模型由 CPU 运行,使用与 Needle 相同的 C++ 引擎,语音不用先上传云端。官网还放出可直接在浏览器中试用的演示,首次使用时下载模型文件。
Whistle 每次处理最长 30 秒的 16 kHz 单声道音频,支持英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语,可自动判断语言。除了转写文字,还能输出每个词的起止时间与概率,以及按音频帧生成的语音向量。开发者可以提供人名、地点或产品名作为关键词,改善特定词汇的识别。
它还可以与 Needle 同时装入一个进程,把一段口头指令接到已有工具调用上,省去应用自己拼接转写与指令解析的步骤。官方性能数据来自 Apple M4 Pro 上的十秒音频测试,首个 token 约 11 毫秒;这不是手机或所有语言的统一延迟。当前语言清单没有中文,中文录音用户需要另选模型。