Om AI联汇押注端侧流式多模态:VLX瞄准物理AI的持续感知与行动闭环
据36氪报道,Om AI联汇CEO兼首席科学家赵天成近日围绕公司物理AI路线与VLX模型系列进行了分享。来源显示,Om AI联汇在多年坚持“视觉+语言”的流式多模态方向后,推出面向物理AI的端侧流式多模态模型系列VLX,试图让机器人、无人机、可穿戴设备、安防摄像头、AI PC等终端具备持续感知、定位与行动决策能力。报道发布时间为2026年7月13日,背景是AI行业热度正从以大语言模型为代表的数字AI,转向更强调真实世界交互的物理AI。
这一路线的一个关键转折点出现在2023年。来源摘要提到,Om AI联汇曾发现,一个没有专门见过监控画面的多模态模型,在监控理解任务上反而比长期基于监控数据训练的小模型表现出更强的泛化能力。这一“无心插柳”的结果,让赵天成更加确信:多模态训练方式可能为物理开放世界带来更强泛化性。在当时生成式AI围绕大语言模型迅速升温的行业环境下,Om AI联汇没有转向纯文本大模型,而是继续押注视觉与语言融合。
从“离线抽帧”到“端侧原生流式”
当前很多视频理解方案仍采用“离线抽帧”思路:把视频切成一帧帧图片,再进行离散推理。这种方式适合问答式、批处理式任务,但对于机器人、无人机和摄像头等真实物理终端来说,世界不是静态图片,而是持续变化的环境流。赵天成所强调的“流式”模型,核心在于让视频像水流一样持续进入模型,AI不必等待人类提问,而是保持连续观察。
来源显示,VLX首次提出“端侧原生流式多模态”架构,并从Day 1就面向端侧算力约束进行设计。其目标并非只在云端完成理解,而是让模型在物理设备本地运行,在连续视频流上形成“持续感知+精准定位+行动决策”的完整闭环。对物理AI而言,这意味着模型不仅要看懂画面,还要判断对象位置、环境变化与下一步动作。
- Flow:面向连续视频流的实时感知能力,解决“持续看见”的问题;
- Seek:在场景中完成对象、位置与目标的识别和定位;
- Go:基于感知与定位结果形成行动决策,推动终端执行下一步动作。
按照来源描述,Om AI联汇强调这三者不是三个割裂模型,而是在同一条视频流上构成不可分割的能力层。这也是其区别于仅做单点视觉识别、视频生成或语言控制方案的关键。
物理AI路线仍未收敛,端侧能力成为竞争焦点
报道指出,站在2026年夏天,物理AI热度已明显升高,但行业技术路线仍未收敛。以语言为中心的VLA、以像素为中心的视频生成、以3D结构为中心的仿真、以视觉表征为中心的JEPA等方向并行推进;VLA与世界模型之间究竟是替代、并存还是融合,仍存在争论。
在这一背景下,VLX的价值不只是“又一个多模态模型”,而是提出了物理终端需要怎样的模型架构:能在端侧低延迟运行、能持续理解开放环境、能把感知结果转化为行动。对于安防、机器人、无人机、可穿戴设备和AI PC等场景,端侧部署意味着更及时的响应、更少的云端依赖,也更贴近实际产业落地需求。
来源还提到,Om AI联汇试图打通三类闭环:模型闭环、数据闭环和商业闭环。模型层面,VLX以Flow、Seek、Go整合感知、定位与行动;数据层面,百万级摄像头、无人机、机器人等真实业务场景持续产生端侧数据并反哺迭代;商业层面,报道称公司已完成PMF,营收以亿为单位。对于物理AI公司来说,这意味着技术路线不只停留在实验室演示,而开始进入真实场景验证。
解读:物理AI需要的不只是更大的模型
赵天成的创业选择也体现出一条非主流路径。来源显示,他2019年从CMU语言技术所博士毕业,曾参与对话系统与端到端生成式模型相关研究;但回国后并未跟随纯文本生成式AI潮流,而是长期围绕视觉与语言两个主模态推进。其判断是,视觉和语言至少覆盖了物理信息中的主要部分。
从今天的产业趋势看,物理AI的挑战并不等同于把大语言模型搬进机器人。真实世界的复杂性来自连续时间、空间关系、动作反馈和硬件限制。云端大模型可以拥有强推理能力,但物理终端需要在受限算力下实时运行。“端侧原生”与“流式”因此成为VLX最值得关注的两个关键词。
当然,物理AI仍处在多路线并存阶段,VLX能否成为更广泛行业标准,还要看其在更多设备类型、复杂场景和长期运行中的表现。但Om AI联汇的案例说明,AI产业正从“会生成内容”走向“能理解并作用于现实世界”。对于中文科技读者而言,这一变化值得持续关注:下一阶段的AI竞争,可能不只发生在聊天窗口里,而会发生在摄像头、机器人、无人机和各种边缘设备之中。