人工智能

智元 WITA-Omni Preview 登顶 DailyOmni:具身全模态理解模型以 85.21 分排第一

2026年7月29日 · admin
openmagic ad

据 IT之家 7 月 28 日消息,智元 AGIBOT 近日公布,其自研具身原生全模态大模型 WITA-Omni Preview 在 DailyOmni 最新评测中取得 85.21 分综合成绩,位列榜单第一。来源显示,该模型在本次评测中超过千问、Gemini、豆包、英伟达等国内外模型,并在八项细分指标中的六项获得第一。对于人形机器人和具身智能领域而言,这一结果的关注点不只是“模型排名”,更在于音视频联合理解、时序推理与真实交互能力正在成为新一轮模型竞争的核心指标。

DailyOmni 评测为何更贴近具身智能需求

与常见的图文理解、短视频问答类评测不同,DailyOmni 更强调开放真实环境中的音视频材料。来源摘要提到,该榜单主要考察模型在音视频时序对齐、跨模态联合推理方面的能力,包括识别画面与环境声音之间的对应关系、判断事件发生先后顺序,以及综合理解跨模态语义。

这类能力对于人形机器人尤其关键。机器人如果要在现实空间中与人互动,不能只“看懂画面”或“听懂语音”,还需要把声音来源、人物动作、表情变化、环境事件与对话意图统一起来。例如,当现场出现响声、手势或表情变化时,机器人需要判断这些信息是否与当前对话相关,并在合适时机作出回应。DailyOmni 的价值就在于把评测重心从静态识别推进到动态场景理解

  • 评测重点包括音视频时序对齐与跨模态推理;
  • 素材更接近真实开放环境,而非单一图文任务;
  • 能力方向与人形机器人感知、交互、响应高度相关;
  • WITA-Omni Preview 以 85.21 分取得综合第一。

从聊天模型到具身原生模型:智元强调端到端交互

据官方说法,WITA-Omni 的关键并不是把一个通用聊天模型简单接入机器人,而是把物理动作和表情提升到与语音并列的一级输出。这意味着模型的输出不再局限于文本或语音回答,而是要同时考虑“说什么”“什么时候说”“用什么动作和表情表达”。

在架构思路上,来源显示智元将 Thinker–Talker 范式进一步扩展为面向具身输出的 Thinker–Talker–Actor 架构,用一个原生端到端模型统一驱动感知、决策与表达。对于具身智能产品来说,这一方向的意义在于减少感知、对话、动作控制之间的割裂,让机器人在交互时更像一个连续系统,而不是多个模块临时拼接。

数据体系成为全模态模型竞争变量

智元方面还强调,WITA-Omni 的表现并非单纯来自模型规模,而是与围绕具身全模态交互构建的数据体系和训练方法有关。来源提到,在中训练阶段,WITA-Omni 使用了千万小时级开源与自有多模态数据,用于将文本、视觉底座升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。

此外,公开音视频数据往往缺少真实交互中的轮次切换、响应时机、动作与表情信息,难以直接训练端到端具身交互模型。为解决这一问题,智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,并保留声音、画面、语言、动作和表情之间的自然时序关系。这说明具身模型的壁垒正在从单纯参数规模,转向场景数据、时序标注和交互闭环

影响与解读:具身智能评测进入“声画动作一体化”阶段

WITA-Omni Preview 登顶 DailyOmni,反映出国内具身智能公司正在把模型能力从语言和视觉理解,推进到更复杂的音视频联合推理与具身表达。对于中文科技产业观察者来说,这类榜单结果值得关注,但也需要放在实际机器人落地中继续验证:实验评测能够说明模型在特定任务上的能力,但真实场景还涉及延迟、稳定性、硬件传感器、运动控制、安全策略等多重因素。

总体来看,全模态理解正在成为人形机器人走向通用交互的基础能力。如果未来模型能够稳定处理声音、画面、语言、动作和表情之间的复杂关系,机器人产品的交互体验将有机会从“能回答问题”迈向“能理解场景并自然回应”。