Google 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。前者面向角色设计和更细致的创作控制,后者针对配音、音频内容和实时语音 Agent 的高频调用。开发者可以用自然语言描述音色、口音和角色,再逐句指定语速、情绪、停顿和对话中的回应声。
官方介绍称,Flash TTS 支持 100 多种语言和方言,并提供超过 2000 个可用于生产的声音。声音复刻需要提供声音所有者的口头同意,系统还会使用 SynthID 水印和 C2PA 凭证。两款模型已开始在 Gemini API 与 Google AI Studio 推出,也会进入 Gemini Notebook 和 Google Vids,企业入口和地区可用范围仍按产品节奏逐步开放。
对创作者来说,这次更新把传统的固定音色库变成了可以反复设计的声音工作台,适合有声内容、游戏角色、播客和语音客服。官方给出的 Hume AI、Voice Arena 等评测属于厂商引用的外部或盲测结果,实际音质、延迟和语言覆盖仍取决于调用方式、内容长度与账户权限。