谷歌发布 Gemini 3.8 Flash TTS 系列:可逐行控制台词表现,面向创作与规模化语音生成
据 IT之家 9 月 23 日消息,谷歌今日宣布为 Gemini 家族加入两款新的文本转语音模型:Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS。这次更新的重点不只是“把文字读出来”,而是把语音生成推进到更接近音频创作工作台的形态:开发者和创作者可以通过自然语言设计声音、控制角色表演,并在脚本层面逐行指定台词的情绪、节奏和表达方式。两款模型已面向开发者推送,可在 Gemini API 和 Google AI Studio 中使用,相关能力也将改善 Gemini Notebook、Google Vids 等产品的音频体验。
两款模型定位不同:创意设计与规模化生成并行
从产品定位看,Gemini 3.8 Flash TTS 更偏向深度创意场景,适合游戏角色、有声读物、播客、互动媒体等需要鲜明人设和复杂表演的内容生产。来源显示,它支持通过自然语言提示从零创建语音,并可对表演提示、节奏、方言转换等进行更细粒度控制。
Gemini 3.8 Flash-Lite TTS 则面向大容量和高性价比场景,主要服务于批量配音、音频内容生成以及语音代理等应用。它同样支持对音调、节奏和表现力进行细微调整,但更强调规模化部署时的效率与成本平衡。
谷歌称,用户可以从原有的 30 种原始语音扩展到更大的语音选择空间,并可访问 2000 多种现成语音,覆盖包括墨西哥西班牙语、魁北克法语、苏格兰英语在内的多种区域变体。对于需要多语言本地化的应用来说,这意味着语音风格不再只是“标准发音”的简单替换,而可以更接近目标市场的地域表达。
从“选声音”到“导表演”:逐行台词控制是关键变化
这次 Gemini 3.8 TTS 系列最值得关注的能力,是将控制粒度下探到每一行台词。创作者可以在脚本中写入舞台指导,也可以让 Gemini 根据自然语言脚本提示来引导交付。例如客服语音可以被设定为更平静,悬疑故事中的角色则可以使用低声、停顿和紧张节奏来增强氛围。
- 生成式语音设计:可用自然语言在 100 多种语言和方言中定制角色、口音与语音特征。
- 语音复制:据报道,仅需 30 秒音频样本即可重现一致的声音特征,并加入同意验证、SynthID 水印和 C2PA 凭据。
- 长篇生成:面向播客、有声读物等连续数小时音频,强调自然节奏、角色音色一致性以及较小的说话人漂移。
- 双声音场景:可从单个脚本中安排多轮对话,并保持两种声音清晰分离。
- 非语言提示:支持加入笑声、叹息、惊讶等提示,以及“mhm”“yeah”等主动倾听反馈,让对话更接近真实互动。
此外,谷歌还预告了“语音混音”能力:用户未来可从语音库选择一种声音,再对音色、音高、节奏和口音进行微调,并用提示进一步调整特征。这类能力如果成熟,将使语音资产更像可编辑的设计素材,而不是一次性生成结果。
性能与安全:AI 语音进入更强表达力阶段
性能方面,来源提到 Gemini 3.8 Flash TTS 在 Hume AI 的语音设计基准测试中取得 71.4 分并位居总体第一,在口音建模方面以 60.8 分处于领先位置。Gemini 3.8 Flash TTS 与 Flash-Lite TTS 在 Hume AI 的整体质量指数中分别排名第一和第二,相比 Gemini 3.1 Flash TTS,在长格式内容和双说话人剧本控制等场景有明显改进。另据来源显示,在 Voice Arena 的盲法人类偏好评估中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等主要语言中表现领先。
不过,语音生成越逼真,身份保护和内容透明度就越重要。谷歌表示,语音复制功能会要求提供语音所有者的口头同意记录,并与参考说话者匹配后才可创建声音。Gemini Audio 模型生成的音频还会嵌入难以察觉的 SynthID 水印,用于识别 AI 生成语音,降低误导性内容风险。
影响解读:多语言内容生产和语音代理会先受益
对于中文科技与 AI 产业观察者而言,Gemini 3.8 Flash TTS 系列的意义在于,文本转语音正在从基础工具升级为可编排、可保存、可复用的音频生产系统。过去,企业做多语言配音常常需要在成本、语音质量、角色一致性之间取舍;而更细的角色控制、更长的稳定生成能力和双人对话编排,会直接推动有声内容、教育产品、客服机器人、虚拟角色和互动应用的生产流程重构。
短期看,开发者可以在 Google AI Studio 中体验通过提示创建新声音身份,或复制自己的声音,再进入双说话人剧本编辑器逐行控制交付。长期看,当 AI 语音具备稳定角色记忆、跨语言迁移和安全水印机制后,音频内容的制作门槛会进一步下降,竞争焦点也会从“能不能合成”转向“能不能以更低成本持续产出可信、自然且有表现力的声音体验”。