人工智能

京东在 WAIC 展示 JoyAI 模型矩阵:推出实时语音交互与视频编辑模型

2026年7月19日 · admin
openmagic ad

据 IT之家消息,2026 世界人工智能大会暨人工智能全球治理高级别会议(WAIC)已在上海世博、张江、西岸“三地四馆”同步启幕。7 月 18 日,京东以“AI 进入物理世界”为核心主题亮相上海世博展览馆,并首次系统展示面向物理世界的 JoyAI 模型矩阵。其中,京东新推出了 JoyAI-Talker 实时语音交互模型与 JoyAI-Video-Edit 实时视频编辑模型,进一步补齐其在语音、视频和实时交互方向的模型能力。

从此次发布看,京东并未只强调单点生成能力,而是将语音理解、视频编辑、视觉交互、具身智能等能力放在同一套 JoyAI 体系中展示。这也意味着,京东正在把大模型应用场景从屏幕内的软件工具,进一步延伸到家庭、设备、线下空间和真实环境中的交互。

JoyAI-Talker:从听懂指令走向理解状态

来源显示,JoyAI-Talker 是一款实时语音交互模型,具备低延迟对话、情绪理解、工具调用和记忆等能力。京东对其定位并非简单的语音助手,而是希望让 AI 从“机械执行指令”转向更能理解人的意图和状态。

具体来看,该模型可通过声纹识别用户身份,并结合环境数据理解对话意图。这意味着,在智能家居、服务机器人、车载座舱、零售导购等场景中,语音交互不再只是“唤醒—命令—反馈”的固定流程,而可能根据用户是谁、当时环境如何、此前上下文是什么来给出更贴近场景的响应。

对于中文用户而言,这类能力的价值在于降低人机交互门槛。相比需要打开应用、点击按钮或输入文字,实时语音模型更适合嵌入到硬件和空间服务中,成为 AI 进入物理世界的重要入口。

JoyAI-Video-Edit:面向流式视频的自然语言编辑

另一款新模型 JoyAI-Video-Edit 则聚焦实时视频编辑。京东介绍称,该模型支持自定义画面和“边预览边修改”,使视频编辑更加实时、灵活。更值得关注的是,它把视频能力延伸到流式编辑:面对持续变化的视频画面,用户可以用自然语言增删物体、替换人物、迁移服装,甚至重构整个场景。

这类能力如果落地成熟,将改变传统视频制作流程。过去,视频编辑通常需要在素材导入后,通过时间线、图层、遮罩、关键帧等工具完成复杂操作;而自然语言驱动的视频编辑模型,则试图把“会剪辑”转化为“会表达需求”。对于内容创作者、电商营销、直播运营和短视频团队来说,这可能显著降低后期制作门槛。

  • 语音方向:JoyAI-Talker 强调低延迟、情绪理解、工具调用、记忆和身份识别。
  • 视频方向:JoyAI-Video-Edit 支持自然语言修改动态视频画面,并可边预览边调整。
  • 体系方向:京东已围绕 JoyAI 基座大模型形成覆盖语音、图像、视频、实时交互、世界模型和具身智能的模型体系。
  • 数据与场景:WAIC 期间京东还开源了人类视角数据集 EgoLive,并打造 JoyInside“AI Home”体验空间。

影响解读:京东押注“物理世界 AI”,关键在场景闭环

今年以来,京东已陆续发布 Joy-Image-Edit、JoyAI-Echo、JoyAI-VL-Interaction 等多个基础模型。此次 JoyAI-Talker 与 JoyAI-Video-Edit 的加入,使其 JoyAI 矩阵进一步从文本、图像扩展到实时语音和动态视频,方向更接近“多模态实时交互”。

这一路线与京东自身业务具有天然关联。京东拥有零售、物流、供应链、家电、智能硬件和线下服务等大量物理场景。如果模型能力能够与设备、仓储、家庭空间和服务流程结合,就不只是面向个人用户的 AI 工具,而可能成为产业自动化和智能服务的基础组件。

不过,实时语音和视频编辑模型要真正进入高频应用,还需要解决延迟、稳定性、成本、隐私和安全边界等问题。尤其是声纹识别、环境理解、第一视角数据采集等能力,都会涉及用户授权和数据治理。京东在 WAIC 上开源 EgoLive,并让观众通过 JoyEgoCam 体验第一视角数据采集,也显示其正在围绕“AI 如何理解真实世界”补充数据基础。

总体来看,京东此次发布的两款模型并不是孤立产品,而是 JoyAI 从基础模型走向场景化落地的一次集中展示。对行业而言,下一阶段竞争重点或许不再只是模型参数和榜单表现,而是谁能把多模态 AI 放进真实设备、真实空间和真实业务流程中