人工智能

OpenAI 发布 GPT-Live-1 与 mini:全双工语音让 ChatGPT 可“边听边说”

2026年7月9日 · admin
openmagic ad

据 IT之家 7 月 9 日消息,OpenAI 于当天发布 GPT-Live 系列语音模型,定位为新一代全双工语音模型,核心变化是让 AI 不再等待用户说完一整轮后才回应,而是可以在对话过程中同时聆听、判断和发声。此次开放的版本包括 GPT-Live-1 与 GPT-Live-1 mini,面向全球 ChatGPT 用户推出:Go、Plus 和 Pro 订阅用户可使用 GPT-Live-1,免费用户则可调用 GPT-Live-1 mini。

从“轮流说话”到实时互动:语音 AI 的体验门槛被抬高

过去多数语音助手采用的是相对明确的回合制交互:用户说完,系统识别语音、理解意图,再生成并播放回复。这种模式在查天气、设提醒等任务中已经足够,但一旦进入闲聊、语言练习、教学辅导或复杂协作场景,就容易出现等待感、打断困难、节奏不自然等问题。

GPT-Live 系列的关键在于全双工架构。来源显示,该模型可在同一时间持续处理输入与输出,并且能够“每秒多次”判断下一步动作:是继续说、继续听、暂停、接受打断,还是调用工具。这意味着 ChatGPT 的语音模式更接近人与人聊天中的动态节奏,而不是简单的语音输入加文本回复。

对于中文用户熟悉的 AI 语音产品来说,这类能力的重点不只是“声音更像真人”,而是模型是否能理解对话中的停顿、犹豫、插话和补充说明。真正自然的语音交互,需要模型在低延迟、语义理解、对话管理和工具调用之间保持平衡。

复杂任务交给后台模型,前台维持语音流

在架构分工上,OpenAI 将 GPT-Live 系列设计为前台语音交互与后台深度处理并行。来源称,模型会在前台维持连续语音对话流,同时把网页搜索、复杂推理或更复杂任务委托给 GPT-5.5 系列模型执行。

  • GPT-Live-1(instant)与 GPT-Live-1 mini 调用 GPT-5.5 Instant。
  • GPT-Live-1 Medium 调用 GPT-5.5 Thinking Medium 推理强度。
  • GPT-Live-1 High 使用 GPT-5.5 Thinking High 推理强度。

这种设计思路类似于把“聊天主持人”和“后台专家”拆开:前者负责让对话不中断,后者负责处理更重的搜索、分析和推理。对用户而言,理想体验是 AI 可以一边回应“我正在查”,一边在后台完成任务,而不是长时间沉默。

新版本还支持在语音对话中展示天气、股票、体育等可视化卡片,并继续支持搜索、记忆、图片和文件上传。这说明 OpenAI 正在把语音模式从单纯的聊天入口,扩展为一个可连接工具、文件和多模态信息的实时助手界面

OpenAI 强调语音舒适度评测,安全边界仍是重点

性能评估方面,OpenAI 表示其建立了新的人工评测体系,重点观察语音交流中的舒适度和整体流畅性。相较此前 Advanced Voice Mode,在 5 到 10 分钟的配对对话中,GPT-Live-1 与 GPT-Live-1 mini 在整体偏好、轮次衔接、打断情况、对话流畅度与自然度等指标上获得更高偏好得分。

用户规模也是这次发布的重要背景。OpenAI 披露,每周有超过 1.5 亿人通过 Voice 和 Dictation 等功能与 ChatGPT 进行语音交互,场景包括免手持日常协助、语言练习、睡前故事和通勤闲聊。如此大的语音使用量,意味着语音模型不再只是演示能力,而正在成为 ChatGPT 的高频入口。

安全方面,OpenAI 称 GPT-Live 在自伤、精神病性症状与躁狂、对 AI 的情感依赖、暴力及性内容等领域接受了音频原生评测、合成音频评测与内部红队测试。官方表示,该模型在几乎所有评估维度上与 Advanced Voice Mode 相当或更优。对于更像真人的语音 AI 来说,情感依赖与高风险内容处理将是长期绕不开的治理问题。

影响解读:语音可能成为 AI 助手的下一层操作系统入口

GPT-Live 的发布表明,大模型竞争正在从“谁更会写答案”进一步延伸到“谁更会实时协作”。当模型能边听边说、能被自然打断、能在对话中调用搜索和文件能力时,语音就不只是输入方式,而可能成为 AI 助手与用户协作的主界面。

对产业而言,这会影响智能耳机、车载助手、会议工具、教育陪练和办公自动化等多个方向。尤其在免手持场景中,全双工语音能显著降低用户操作成本,让 AI 更像随时在场的协作者。不过,体验提升也会带来更高的隐私、安全和心理边界要求。接下来,语音 AI 的竞争重点可能不只是音色和延迟,而是自然交互、可靠推理、工具执行与安全控制的综合能力。