蚂蚁百灵开源 Ling-3.0 tiny/flash Base:同步放出训练关键节点 checkpoint
据 IT之家 8 月 21 日消息,蚂蚁百灵近期陆续开源 Ling-3.0-tiny 与 Ling-3.0-flash 模型后,官方进一步宣布开放 Ling-3.0-tiny-base 和 Ling-3.0-flash-base。此次开源的重点不只是最终 Base checkpoint,还包括两个模型在预训练和中期训练阶段的权重节点,总计 6 个 checkpoints。对于关注大模型训练、继续预训练和行业微调的开发者来说,这意味着模型从“训练中间态”到“可继续加工底座”的更多环节被公开,研究和复现实验的空间更大。
不只开源结果,也开放训练过程中的关键状态
来源显示,本次开放的 checkpoint 覆盖了三个阶段:预训练 checkpoint、中期训练 checkpoint,以及 WSM 合并 checkpoint。预训练 checkpoint 指模型已经完成大规模预训练,但尚未进入中期训练、WSM 合并和后训练;中期训练 checkpoint 则代表模型完成中期训练,但还没有进行 WSM 合并和后训练;WSM 合并 checkpoint 是基于中期训练 checkpoint 完成加权合并后的版本,但同样未经过后训练。
这里的 Base Model 可以理解为未经特定任务指令微调的基础模型底座,它通常用于后续继续训练、领域适配或模型研究,而不是直接面向普通用户的聊天产品。官方也特别提醒,Base Model 并非已经完成指令对齐的聊天模型,不建议未经后训练就部署为终端用户聊天服务,也不建议在缺少额外对齐和评估的情况下用于安全关键场景。
- 预训练 checkpoint:适合研究大规模预训练后的基础能力与继续训练起点。
- 中期训练 checkpoint:适合观察中期训练带来的能力变化,并用于领域扩展。
- WSM 合并 checkpoint:适合作为后训练前的开放底座,用于探索不同训练策略。
WSM 思路:把学习率衰减改为 checkpoint 加权合并
在训练策略上,蚂蚁百灵官方提到,中期训练结束后,团队将传统学习率衰减改写为 checkpoints 加权合并,即 WSM(Warmup-Stable and Merge)。这一做法的核心意义在于,训练阶段不再依赖常规学习率衰减,而是通过合并不同 checkpoint 来获得目标状态。
从开发者视角看,这可能提升 Base 模型在持续预训练中的灵活性。由于没有传统学习率衰减的限制,模型更适合动态扩展数据,也支持在训练结束后离线探索不同学习率“衰减曲线”。对于需要不断接入新语料、行业知识或企业私有数据的团队,这类开放节点比单一最终模型更有研究价值。
tiny 与 flash:面向不同算力和研究需求
参数规模方面,Ling-3.0-tiny-base 的总参数为 7.9B,激活参数为 1.3B。官方称,该模型在总参数量约为前代 50% 的情况下,在多数评测中获得更高结果;与同等规模模型相比,也展现出更具竞争力的代码能力。对于资源受限但希望开展代码、推理或垂直领域实验的团队,tiny 版本更像是一个低门槛底座。
Ling-3.0-flash-base 的总参数为 124B,激活参数为 5.1B,采用更大参数容量与稀疏激活设计。来源摘要提到,在代码、复杂推理和长上下文方向,该模型表现突出;即便与总参数量约为其 2–3 倍的 base model 相比,整体表现仍具优势。对于需要构建高能力模型、探索 MoE 系统或长上下文能力的研究者,flash 版本提供了更大的扩展空间。
影响解读:开源竞争从“模型可用”走向“训练可研究”
过去一段时间,开源大模型更多强调推理效果、榜单成绩和部署便利性,而此次蚂蚁百灵同步开放训练中间 checkpoint,释放了一个更偏研究和工程化的信号:模型开源不只是给出一个可下载结果,也开始向训练过程透明度延伸。
这些 checkpoints 可用于持续预训练、领域监督微调、偏好优化、强化学习后训练、蒸馏、长上下文研究以及 MoE 系统研究。对中文 AI 生态而言,开放关键训练节点有助于高校、研究机构和企业团队复现实验、验证训练方法,并围绕真实业务场景做更细粒度的模型适配。但同时,Base 模型的开放也要求使用者具备必要的安全评估和对齐能力。任何生产部署都应围绕具体任务完成后训练、评估与验证,而不能把基础模型直接包装成面向用户的通用聊天服务。