ElevenLabs 发布 v4 系列语音模型:10 秒音频克隆声音,面向语音智能体降低延迟
据 IT之家 9 月 29 日消息,AI 语音初创公司 ElevenLabs 于当地时间周一正式推出两款新一代语音模型:ElevenLabs v4 与 v4 Turbo。新版本在语音情绪控制、跨语言合成、声音克隆速度以及语音智能体响应延迟等方面进行了升级,支持语言数量从旧版的 70 种提升至 90 余种。来源显示,ElevenLabs 去年发布 v3 模型,并在今年早些时候于华沙举办的活动中预热了这一代模型。
对于中文 AI 与工具用户而言,v4 系列的看点不仅是“能说更多语言”,更在于其面向内容生产和实时语音交互的能力强化:官方称,用户只需 10 秒音频素材即可完成声音克隆;在朗读长文本时,模型也能更稳定地维持说话人的音色,并根据前后文调整语气。这意味着 AI 配音、播客生成、视频本地化以及客服语音智能体等场景,都可能获得更低门槛的语音生成能力。
v4 系列升级重点:从声音克隆到情绪控制
ElevenLabs 表示,v4 系列采用了全新架构,目标是实现更细颗粒度的语音控制,以及更快的声音克隆流程。与此前版本相比,新模型不只是生成“像某个人说话”的音频,还试图在大段文本朗读、语境理解和情绪表达上提升一致性。
在 v3 中,ElevenLabs 已经引入内联标签功能,用户可以通过标签设定语音情绪。到了 v4,这一能力进一步扩展:用户可以叠加多个标签,模型会按照标签出现的先后顺序执行。这类设计对创作者和企业用户都很重要,因为实际内容中往往存在复杂语气变化,例如从平静叙述转向强调、从解释转向安抚,单一情绪标签很难覆盖完整表达。
- 语言覆盖扩大:支持语言由旧版约 70 种提升至 90 余种。
- 声音克隆门槛降低:官方称 v4 可通过 10 秒音频素材完成语音克隆。
- 长文本稳定性增强:朗读大段内容时更能维持说话人音色特征。
- 情绪标签更灵活:支持多个标签叠加,并按顺序影响语音输出。
- 实时交互优化:v4 Turbo 面向低延迟场景,适合语音智能体使用。
中文与多语言场景:普通话、粤语质量提升值得关注
来源显示,ElevenLabs 称新版本在日语、巴西葡萄牙语、普通话和粤语上的合成质量提升最为明显。对中文市场来说,这一点尤其值得关注。过去不少语音合成工具在英语内容上表现较好,但面对普通话的语调、断句、轻重音,以及粤语更复杂的声调系统时,常常容易出现机械感或语气不自然的问题。
如果 v4 系列在普通话和粤语上确有明显改善,那么它将更适合用于中文短视频配音、AI 有声书、多语言品牌内容、本地化广告和智能客服等应用。尤其在跨境内容生产中,创作者可能只需准备少量原声素材,就能生成多语言版本配音,从而降低传统录音、翻译配音和后期制作成本。
不过,声音克隆能力的增强也会带来更高的合规和安全要求。仅需少量音频即可生成相似声音,意味着平台需要在授权、身份验证、水印标识和滥用检测方面建立更严格机制。对于企业用户而言,部署此类语音模型时也需要明确声音素材来源和使用范围,避免在营销、客服或培训内容中引发肖像权、声音权争议。
影响解读:语音智能体正在从“能听能说”走向“会接话”
ElevenLabs 过去一年企业语音通话业务增长明显,来源显示,目前超过 55% 的业务收入来自大型企业。该公司强调,新模型非常适配语音智能体场景,原因在于更低延迟可以带来更自然的对话体验。更进一步,当后端大语言模型刚开始输出回答时,v4 就可以同步生成语音音频,而不必等待完整文本生成后再统一合成。
这类能力对 AI Agent 的落地很关键。传统语音机器人常见问题是等待时间长、打断困难、语气僵硬,用户很容易意识到自己在与机器交互。而在大模型驱动的语音智能体中,系统需要同时处理语音识别、意图理解、回答生成、语音合成和通话状态管理。任何一个环节延迟过高,都会破坏对话流畅度。
据报道,v4 还能够针对争执对话、诉求升级和通话等待等场景进行差异化处理。这表明语音模型的竞争点正在从“音色逼真”转向“业务可用”:在客服、销售、预约、催收、售后等场景中,模型不仅要说得自然,还要根据对话状态调整语气和节奏,避免激化用户情绪,并把复杂问题引导到合适流程。
资本与商业化:AI 语音赛道进入企业级竞争阶段
商业层面,ElevenLabs 仍处在快速扩张期。来源显示,该公司今年早些时候从红杉资本获得 5 亿美元融资,投后估值达到 110 亿美元;目前已有传闻称其正筹备新一轮融资,目标估值或达 220 亿美元。其年化营收运行速率也从年初约 3.3 亿美元提升至 6 亿美元以上,员工总数已突破 800 人,并在印度、欧洲、巴西等市场招人。
这些信息反映出 AI 语音不再只是内容创作者工具,而是在向企业通信基础设施延伸。随着大语言模型、实时语音合成和语音识别能力结合,企业将更倾向于把电话、客服、销售跟进和内部流程自动化交给可控的语音智能体完成。ElevenLabs v4 与 v4 Turbo 的发布,也可以看作其从“高质量语音生成工具”向“企业级语音交互平台”迈进的一步。
不过,该公司联合创始人兼首席执行官 Mati Staniszewski 近期在接受 TechCrunch 采访时表示,公司计划在“未来几年内”完成 IPO 上市,但尚未给出确切时间节点。对整个 AI 语音行业而言,接下来的关键问题将是:模型能力提升能否持续转化为企业付费、低延迟语音智能体能否稳定落地,以及声音克隆技术如何在效率与安全之间取得平衡。