人工智能

腾讯混元多模态负责人胡瀚被曝离职创业,原团队或转向世界模型研究

2026年7月24日 · admin
openmagic ad

据《智能涌现》报道,近期腾讯混元多模态理解负责人胡瀚已提出离职并将创业。截至来源发稿,腾讯方面未对相关信息作出回复。胡瀚曾任微软亚洲研究院视觉计算组首席研究员,2025年初加入腾讯后负责视觉大模型研究,随后在组织调整中进入大语言模型部旗下“Frontier”前沿技术研究组,负责多模态理解方向并向姚顺雨汇报。来源还显示,胡瀚此前也承担过世界模型相关研发工作,而其所在研究组接下来或将把重点转向世界模型等更前沿方向。

从多模态理解到世界模型:混元团队重心正在变化

这次人员变动的背景,是腾讯混元体系自2026年年中以来持续进行的组织梳理。来源称,腾讯大语言模型部负责人姚顺雨近期正在密集梳理旗下团队,核心目标是将人才、算力与研发资源进一步集中到基础大模型能力建设上。

在胡瀚之前负责的视觉语言模型(VLM)方向上,前 OpenAI 研究员、麻省理工学院博士田永龙已于7月初加入腾讯大语言模型部。来源称,田永龙将接替胡瀚负责 VLM 研发,并向姚顺雨汇报。这意味着腾讯并非放弃视觉语言模型,而是可能在人员与研究方向上进行再分配:成熟能力继续保留,前沿探索则向世界模型等更高风险、高潜力方向迁移。

所谓世界模型,通常指模型对环境、状态变化与因果关系形成更深层的内部表征,从而支持预测、规划与交互。对于游戏、机器人、自动驾驶仿真、智能体训练等场景而言,世界模型被视为下一阶段 AI 系统突破“看懂”与“会生成”之后的重要方向。腾讯拥有游戏、社交、内容与云服务等业务场景,如果相关研究推进顺利,未来可能与智能体、虚拟世界和交互式内容生成形成结合。

多模态理解红利趋缓,基础模型优先级上升

来源提到,腾讯正在重新衡量各条 AI 技术路线的投入产出。一方面,多模态理解研究已经相对成熟,在文字、图像、视频识别等任务上,行业能力已有较高水平;另一方面,更难的部分在于视觉推理,即模型不仅要识别画面内容,还要理解图像和视频背后的含义、意图和逻辑关系。业内观点认为,这一步仅依赖传统多模态理解并不足够,还需要语言模型推理能力的整体提升。

从商业化看,多模态理解过去之所以在腾讯 AI 体系中占据重要位置,是因为计算机视觉可与广告、游戏、影音等业务结合。但相比生成式 AI,多模态理解对应的识图、看图写话等场景付费意愿并不清晰。来源中有产品侧观点指出,用户更愿意为文档处理、PPT 制作、研报生成等办公任务付费,而这些能力背后依赖的是推理、代码生成与 Agentic 能力

  • 组织层面:腾讯撤销 AI Lab 后,核心研发人员并入大语言模型部,资源集中度提升。
  • 人才层面:大语言模型相关招聘增强,来源提到已有来自字节 Seed Infra 团队和后训练团队的人员加入。
  • 技术层面:混元的重点从单点多模态能力,进一步转向基模、数据、Infra、评测和前沿模型研究。
  • 产品层面:更贴近办公、创作与智能体的应用,可能成为腾讯 AI 商业化的优先方向。

算力约束下的取舍:腾讯要先补齐基模短板

来源指出,与字节、阿里相比,腾讯在算力资源投入上并不占优势。其引用财务与报道信息称,2025年腾讯资本开支为792亿元;截至2026年3月,阿里财年资本开支达到1260亿元;另据彭博社报道,字节2026年计划将 AI 基础设施投入最高推至700亿美元。在这种背景下,混元内部资源需要更明确地服务于战略优先级。

姚顺雨加入腾讯后,外界对混元的关注点集中在基础模型能否追赶第一梯队。来源称,他上任后的核心举措之一,就是重新梳理资源分配,将人才与算力聚焦到大语言模型部负责的基础模型研发。腾讯在7月6日发布的大模型 Hy3,被视为姚顺雨加入后的首份正式答卷;来源称,在同等参数量的中等尺寸模型中,Hy3 已能与 GLM-5.2、DeepSeek V4 Pro 等模型竞争。

对腾讯而言,胡瀚离职本身是一项重要人事变化,但更值得关注的是背后的战略信号:当多模态理解的边际收益下降,且算力与人才必须集中使用时,腾讯混元正在把更多资源押注在基础模型能力提升世界模型等前沿方向上。对于中文 AI 产业观察者来说,这反映出大厂 AI 竞争正在进入新阶段——不再只是堆功能、扩模态,而是围绕推理、智能体、数据工程、训练基础设施以及未来交互形态展开系统性竞争。