人工智能

谷歌发布 Gemini 3.8 Live 双模型:实时语音对话升级,支持 97 种语言自动切换

2026年9月16日 · admin
OpenMagic API

据 IT之家消息,谷歌于当地时间 9 月 15 日宣布推出两款实时对话模型:Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。谷歌称,这是其迄今最先进的实时对话模型组合,重点升级了对话智能、并行推理、视觉理解和工具调用能力。两款模型定位有所区分:前者面向规模化部署与成本效率,后者则面向复杂任务和多步推理场景,试图让语音 AI 从“能听会说”进一步走向“边想边做”。

两款 Live 模型分工明确:一个强调规模,一个强调深度推理

Gemini 3.8 Live 的核心目标是把实时语音交互做得更稳定、更自然,并兼顾部署成本。来源显示,该模型支持近实时处理视觉输入,可在对话中自动识别并切换 97 种受支持语言,同时还能在后台执行工具与 API 调用,尽量不打断正在进行的交流。

这意味着它不只是语音聊天模型,而更接近一个可嵌入应用、客服、助理和硬件设备的实时多模态交互层。对于开发者和企业来说,成本效率与并发规模往往比单项推理能力更关键,因此 Gemini 3.8 Live 更适合大规模部署。

Gemini 3.8 Live Extended Thinking 则更偏向“复杂任务代理”。据报道,它能够在发言的同时进行推理,在不明显牺牲对话流畅度的前提下处理多步骤工作流。比如模型可以用类似“让我确认一下……”的自然提示争取思考时间,并在执行后台任务时实时解释进度,从而降低用户对等待和不确定性的感知。

  • Gemini 3.8 Live:侧重流畅对话、视觉理解、语言切换、成本控制和规模化部署。
  • Gemini 3.8 Live Extended Thinking:侧重复杂任务、多步推理、并行思考与发言、工作流执行说明。
  • 两款模型都面向语音驱动界面和智能体场景,而不是单纯文本聊天。

基准测试显示语音智能体能力继续前移

在性能方面,来源摘要提到,Gemini 3.8 Live Extended Thinking 在多项测试中取得领先表现。其中,它在 Artificial Analysis 语音对语音质量指数中总排名第一,成绩为 82.6%;在 τ-Voice 智能体任务完成率测试中达到 68.6%;在 Sierra 的 τ-Voice-banking 基准测试中达到 35.1%;在推理相关的 Big Bench Audio 中得分 97.7%。

Gemini 3.8 Live 则在用户评价层面表现突出,在 Speech Agent Arena 排名第二,并强调成本效益。两款模型还在 ServiceNow EVA-Bench 语音智能体基准测试中,在准确性与对话质量之间取得平衡,推动复杂工作流的帕累托前沿。

从这些信息看,谷歌此次并非只强调“声音更像人”或“延迟更低”,而是将语音模型放进真实任务链条里衡量:能否理解上下文、调用工具、完成任务、解释过程,并维持自然对话体验。这也是当前语音智能体竞争的关键方向。

对开发者与企业意味着什么

谷歌表示,开发者可以通过 Gemini Live API,在声网、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等平台构建和部署语音驱动界面。与此同时,谷歌也与 Salesforce、Genspark、Lumeris 等企业合作推进生态建设。

对于中文开发者和企业用户而言,这类模型的价值主要体现在三个方面。第一,语音界面可能成为 AI 应用的新入口,尤其适合客服、教育、医疗咨询、办公助理、车载和硬件设备。第二,97 种语言自动切换有助于跨语言场景,但具体体验仍取决于各语言语音识别、表达自然度和行业术语理解。第三,后台工具与 API 调用能力使语音交互不再停留在问答,而是可以连接 CRM、工单、搜索、日程、文档等系统。

不过,实时语音智能体的落地也会带来新的工程挑战,例如延迟控制、权限管理、工具调用安全、业务系统接入,以及复杂任务失败时的回退机制。Extended Thinking 这类“边说边想”的能力,若能稳定运行,将有助于提升复杂流程的可解释性,但企业仍需要对关键操作设置审计与人工确认。

上线范围与内容安全措施

目前,Gemini 3.8 Live 已开始推送,开发者可在 Gemini API 和 Google AI Studio 使用;企业用户可在 Gemini Enterprise 抢先体验,并将登陆 Gemini Enterprise for Customer Experience;普通用户可在 Search Live 中体验。

Gemini 3.8 Live Extended Thinking 也已开启推送,开发者同样可通过 Gemini API 和 Google AI Studio 使用;企业用户可在 Gemini Enterprise 抢先体验,并将面向 Gemini Enterprise for Customer Experience 以及 Google Workspace 企业客户;普通用户可在 Gemini Live 体验,Google AI Pro 和 Ultra 订阅者可在 Google Workspace 的 Docs 使用,所有 Google AI 订阅者可在 Gmail 和 Keep 中体验。

在内容安全方面,谷歌表示所有 AI 生成音频都加入 SynthID 隐形水印,直接嵌入音频输出,用于检测 AI 生成内容并帮助防止虚假信息传播。随着实时语音生成能力增强,音频水印与检测机制将成为平台治理的重要组成部分。

总体来看,Gemini 3.8 Live 系列体现了实时 AI 对话模型的下一步趋势:不只是更自然地聊天,而是将语音、多模态感知、工具调用和多步推理整合为可部署的智能体基础设施。对于正在建设 AI 客服、办公自动化和语音交互产品的团队,这将是值得关注的新一轮平台能力升级。