人工智能

OpenAI 推出 GPT-Live-Transcribe 与 GPT-Transcribe:面向实时与批量场景的新版转录模型

2026年7月29日 · admin
openmagic ad

据 IT之家 7 月 29 日消息,OpenAI 当天在 X 平台发布公告,推出两种新的语音转录模型:GPT-Live-TranscribeGPT-Transcribe,并开放 API 调用。前者面向低延迟实时转录,后者面向已完成音频文件和批量任务的异步转录。OpenAI 表示,相比此前模型,新模型在上下文理解、口音和多语言真实音频处理方面有更好表现,尤其针对短语、数字、专业术语以及高背景噪音下的人声转写进行了优化。

两种模型分别对应实时与离线转录需求

从产品定位看,GPT-Live-Transcribe 更适合会议字幕、直播字幕、语音助手、客服通话实时记录等需要快速响应的场景。其核心卖点是低延迟,也就是尽可能缩短从语音输入到文字输出之间的等待时间。对于需要边说边显示、边通话边分析的应用来说,这类模型的稳定性和响应速度将直接影响用户体验。

GPT-Transcribe 则更偏向离线和批处理场景,例如播客、采访录音、课程音频、企业会议归档、媒体素材整理等。来源显示,该模型针对已经录制完成的音频文件和批量工作负载进行优化,更适合在准确率、成本和任务吞吐量之间寻找平衡。

费用方面,来源称 GPT-Live-Transcribe 的转录费用为每分钟 0.017 美元,约合人民币 0.12 元;GPT-Transcribe 的转录费用为每分钟 0.0045 美元,约合人民币 0.03 元。对于开发者和企业用户而言,实时模型价格更高,但换来的是即时性;离线模型单价更低,适合大规模音频资料处理。

上下文理解成为转录模型的新竞争点

传统语音识别系统常见问题是“听清了音,却没听懂语境”。例如数字、人名、行业术语、缩写、同音词,在没有上下文辅助时容易被误识别。OpenAI 此次强调新模型可以更好理解上下文,意味着转录能力正在从单纯的声学识别,向结合语义和场景的 Context Aware ASR 方向演进。

来源数据显示,在 Context Aware ASR 基准测试中,GPT-Transcribe 的语义准确率从无自由形式上下文时的 41.6% 提升到有上下文时的 45.2%。在 Common Voice 的 22 种语言上,GPT-Transcribe 的转录错误率为 19.27%,而 Whisper(whisper-1)为 40.37%。在真实世界音频录制基准的九种语言上,GPT-Transcribe 的转录错误率为 8.98%,Whisper(whisper-1)为 15.21%。这些数据表明,OpenAI 正试图用新一代模型替代早期 Whisper API 在复杂场景中的部分能力边界。

  • 实时场景:GPT-Live-Transcribe 面向低延迟应用,适合字幕、通话和互动式语音产品。
  • 批量场景:GPT-Transcribe 面向录音文件和异步任务,适合内容生产与资料归档。
  • 复杂音频:官方强调可处理不同口音、语言以及带明显背景噪音的真实音频。
  • 开发者接入:两款模型均支持 API 调用,便于集成到现有应用和工作流中。

对 AI 应用开发者意味着什么

对中文科技与 AI 应用生态来说,这次更新的关键不只是“转录更准”,而是语音输入正在成为更多 AI 工作流的前端入口。无论是会议纪要生成、销售通话分析、在线教育内容结构化,还是视频创作者自动生成字幕与摘要,转录质量都会影响后续大模型总结、检索、问答和自动化处理的效果。

如果转录环节无法准确识别专业词汇、数字和上下文,后续再强的文本模型也可能基于错误内容进行分析。因此,新模型强调上下文理解与真实世界音频表现,实际是在补齐多模态 AI 应用中“语音到文本”这一基础层能力。

不过,开发者在选择时仍需结合延迟、价格、准确率和数据处理流程权衡。实时互动产品更可能采用 GPT-Live-Transcribe;内容归档、媒体转写和企业知识库建设,则更适合 GPT-Transcribe。随着 OpenAI 将转录能力进一步 API 化,语音数据结构化的门槛有望继续降低,也会推动更多面向会议、客服、教育和内容生产的 AI 工具升级。