返回快讯列表
工具上新

Google 发布 Gemini 3.8 Flash TTS:可按台词控制情绪并创建自定义声音

Gemini 3.8 Flash TTS 与 Flash-Lite TTS 支持自定义声音、逐句表演控制和多语言生成,并加入同意校验与 SynthID 水印。

Google 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。前者面向角色设计和更细致的创作控制,后者针对配音、音频内容和实时语音 Agent 的高频调用。开发者可以用自然语言描述音色、口音和角色,再逐句指定语速、情绪、停顿和对话中的回应声。

官方介绍称,Flash TTS 支持 100 多种语言和方言,并提供超过 2000 个可用于生产的声音。声音复刻需要提供声音所有者的口头同意,系统还会使用 SynthID 水印和 C2PA 凭证。两款模型已开始在 Gemini API 与 Google AI Studio 推出,也会进入 Gemini Notebook 和 Google Vids,企业入口和地区可用范围仍按产品节奏逐步开放。

对创作者来说,这次更新把传统的固定音色库变成了可以反复设计的声音工作台,适合有声内容、游戏角色、播客和语音客服。官方给出的 Hume AI、Voice Arena 等评测属于厂商引用的外部或盲测结果,实际音质、延迟和语言覆盖仍取决于调用方式、内容长度与账户权限。

更多快讯