Fish Audio 的四个模型在 8 月 19 日接入 Vercel AI Gateway,免费用到 9 月 18 日。之后语音合成每百万字符 15 美元,转写每小时音频 0.36 美元。
三个合成模型分工不同。fish-audio/s2.1-pro 是最新的一个,为低延迟流式设计,能从一段参考录音克隆音色。fish-audio/s2-pro 覆盖约 80 种语言,支持在文本里内联写自然语言标签,逐词或逐句调整语气,而不是整段一个风格。fish-audio/s1 认识文本里表示情绪、语调和音效的标记。转写用 fish-audio/transcribe-1,返回文本、音频时长和精确到词的分段时间戳。
有一个计费细节要提前设好。直接调 fish-audio/s2.1-pro 这种普通名字,活动一结束就自动开始扣费;在名字后面加 -free 后缀,活动结束时这个模型直接停止服务,不会悄悄产生账单。做实验或者给免费用户用的功能,后缀那种更安全。
调用要 AI SDK 7。合成走 experimental_generateSpeech,音频从 result.audio.uint8Array 拿。转写走 experimental_transcribe,输入接受 buffer、base64 字符串或者 URL,结果里 result.segments 每一段带起止秒数。不想写代码的话,Vercel 模型列表页里点开模型就能在浏览器里直接试。