Google 8 月 26 日发布 Gemini 3.5 Transcribe,官方称是目前最精确的语音转文字模型。它的输出是整理过的文本,会处理说话人的自我更正,去掉 um、ah 这类填充词,还会自动排版。逐字听写不是它的目标。
能力上支持自动识别并转写 85 种以上语言,含地区口音和方言;能给最多三位说话人做区分并打时间戳,超过三人官方标为实验性;支持自定义词表,用来兜住行话和不常见的拼写;对邮编、订单号这类字母数字混排的内容有专门优化。在 macOS 版 Gemini 应用里,它还能通过函数调用把生成图片、分析文件这类活派给别的 Gemini 模型。
发布分两个 API。gemini-3.5-transcribe-live 走 Live API,双向流式,官方说延迟在一秒以内,适合实时字幕和语音助手。gemini-3.5-transcribe 走 Interactions API,处理预录音频,带说话人归属和词级时间戳。开发者侧通过 Google AI Studio 和 Google Antigravity 的 Gemini API 进入公开预览。
数据引的是 Artificial Analysis 的测试,平均词错率流式 4.0%、非流式 2.6%,FLEURS 多语种上流式 5.50%、非流式 5.04%,出最终转写的时间比 Chirp 3 快 70%。第三方接入方列了 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents。原文没有写定价。