人工智能

蚂蚁百灵发布 Ling-3.0-flash:124B 总参数混合推理模型,对标上一代 1T 旗舰

2026年7月25日 · admin
openmagic ad

据 IT之家 7 月 24 日消息,蚂蚁集团旗下百灵大模型发布新一代原生混合推理模型 Ling-3.0-flash。来源显示,该模型总参数量为 124B,激活参数量为 5.1B,官方称其在规模显著小于上一代 1T 级旗舰思考模型 Ring-2.6-1T 的情况下,实现了能力对标甚至在部分维度超越。与此同时,Ling-3.0-flash 已在 OpenRouter 与百灵官方平台同步开放限时免费 API 调用,免费期截至北京时间 8 月 3 日 23:00,模型权重将在免费期结束后正式开源。

用更小激活规模挑战上一代旗舰

从官方披露的信息看,Ling-3.0-flash 的核心卖点并不是单纯堆大参数,而是强调“智能密度”和实际部署效率。其总参数量 124B,约为 Ring-2.6-1T 的 12.4%;激活参数量 5.1B,约为 Ring-2.6-1T 的 8.1%。这意味着在一次推理中真正参与计算的参数规模更低,理论上有利于降低推理成本、提升响应速度,也更适合面向高频调用的 Agent 和企业应用场景。

官方介绍称,该模型从预训练阶段开始采用原生混合线性注意力架构,以 5:1 的方式交替堆叠 KDA 与 MLA,并升级了新的 KDA 细粒度对角门控与 1/64 稀疏 MoE。对于中文 AI 产业观察而言,这类设计体现了当前大模型竞争的一个重要方向:从“参数量军备竞赛”转向“架构效率、上下文能力和推理成本”的综合优化。

面向 Agent:长程交互和闭环任务是重点

Ling-3.0-flash 的另一条主线是 Agent 能力。来源摘要显示,百灵围绕真实生产力场景进行了深度打磨,扩展了 10,000+ 可交互训练环境,覆盖 Coding、General 与 Deep Research Agent 等任务,目标是让模型在复杂任务中具备更强的执行、反馈和协同能力。

官方还提到,Ling-3.0-flash 接入了 SGLang HiCache + Mooncake 分级缓存架构,包含物理双池与集群共享 L3,使长程交互无需重算。在长输入场景下,TTFT 降低 60% 至 80% 以上。这里的 TTFT 通常指首个 token 返回时间,对于聊天助手、代码 Agent、研究型 Agent 等连续交互产品来说,首响速度会直接影响用户体验和系统吞吐。

  • 参数效率:124B 总参数、5.1B 激活参数,强调低激活成本下的能力释放。
  • 架构路线:采用混合线性注意力,并结合稀疏 MoE,服务长上下文与推理效率。
  • 应用重点:面向 Coding、通用任务与 Deep Research Agent,强调任务闭环。
  • 开放节奏:先开放限时免费 API,随后计划开源模型权重。

影响解读:国产模型竞争进入“可落地效率”阶段

过去一年,国内大模型厂商不断推出更大规模、更强推理能力的模型,但企业侧真正关注的往往是成本、时延、稳定性和工具协同能力。Ling-3.0-flash 将“flash”作为命名的一部分,并突出快、省、可落地,说明百灵希望把模型定位在高性价比推理与 Agent 生产力场景,而不仅是榜单能力展示。

对于开发者和企业用户来说,限时免费 API 有助于快速测试模型在长文本、代码生成、复杂指令遵循、多轮任务拆解等场景中的表现;后续权重开源则可能降低私有化评估和二次开发门槛。不过,模型是否能真正对标上一代 1T 旗舰,还需要结合更完整的公开评测、实际业务压测和多语言场景体验来判断。

总体来看,Ling-3.0-flash 反映出一个明确趋势:大模型厂商正在把重点从“模型够不够大”转向单位计算成本下能提供多少有效智能。如果其在长上下文、Agent 闭环和推理效率方面的官方描述能够在实际应用中兑现,将为国产模型在软件效率工具、自动化工作流和企业级智能应用中提供新的选择。