月之暗面开源 Kimi K3:2.8 万亿参数、百万 token 上下文,训练 Infra 同步开放
据 IT之家 7 月 27 日消息,月之暗面于当晚正式开源 Kimi K3 模型,同步发布模型权重、技术报告,并开放支撑其训练的关键基础设施技术 MoonEP、FlashKDA 和 AgentEnv。来源显示,Kimi K3 是一个 2.8 万亿参数规模的模型,采用 KDA 混合线性注意力机制(Kimi Delta Attention)与注意力残差(Attention Residuals)等技术构建,原生支持视觉理解,并具备 100 万 token 上下文窗口。对于中文 AI 生态而言,这次发布不仅是一次大模型权重开源,也将训练系统、算子与强化学习环境等底层能力进一步推向开发者社区。
2.8 万亿参数开源模型:Kimi K3 把重点放在规模、长上下文与多模态
从公开信息看,Kimi K3 的最大看点首先是模型规模。官方表示,Kimi K3 是首个达到 2.8 万亿参数规模的开源模型,并称在过去 12 个月中的 9 个月里,Kimi 模型保持着开源模型的规模上限。这意味着月之暗面正在持续将大参数模型作为其开源路线中的重要方向。
技术结构上,Kimi K3 基于 KDA 混合线性注意力机制和注意力残差技术构建。来源摘要提到,模型还进一步扩大了 MoE(Mixture of Experts,混合专家模型)的稀疏度:在结合 Stable LatentMoE 框架后,可以在 896 个专家中高效激活 16 个。MoE 架构的核心价值在于,并非每次推理都调用所有参数,而是通过路由机制激活部分专家,从而在扩大模型容量的同时控制计算开销。
官方称,结合训练方法与数据配方优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能够更有效地把算力转化为模型能力。对开发者和研究机构来说,这类效率提升尤其关键,因为大模型竞争已经不只是“堆参数”,还包括训练稳定性、算力利用率、长上下文处理效率和工具调用能力。
- 模型规模:2.8 万亿参数,官方称为首个达到该规模的开源模型。
- 上下文能力:原生支持 100 万 token 上下文窗口,面向长文档、代码库和复杂任务。
- 多模态能力:原生支持视觉理解,可结合截图和视觉反馈执行任务。
- MoE 机制:在 896 个专家中激活 16 个,提高大规模模型的计算效率。
- 同步开源:除权重和技术报告外,还开放 MoonEP、FlashKDA、AgentEnv 等 Infra 技术。
面向工程任务:长程编码、终端工具与视觉反馈成为重点
相比单纯文本问答,Kimi K3 的能力描述更强调复杂工程任务。来源显示,Kimi K3 具备较强的长程编码能力,在极少人工监督的情况下,可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。这类能力与当前 AI Agent、自动化软件开发和代码协作平台的趋势高度相关。
过去一年,AI 编程工具的竞争从“补全代码”逐渐转向“理解项目、规划修改、执行命令、验证结果”。如果模型能够处理大型代码库,并在长上下文中保持对依赖关系、文件结构和任务目标的理解,就更适合承担真实工程场景中的重构、调试、测试与迁移任务。Kimi K3 的 100 万 token 上下文窗口,也正是面向这类复杂任务的重要基础。
此外,Kimi K3 被描述为擅长结合软件工程与视觉推理的任务,能够利用截图和视觉反馈,优化游戏开发、前端和 CAD 等场景。这意味着模型不只是读取代码或文本说明,也可以结合界面状态、设计图或运行画面进行推理。对于前端开发、交互设计、低代码工具、游戏编辑器和工业软件来说,视觉反馈有助于把“代码修改”与“实际呈现效果”连接起来。
Infra 同步开源:从模型权重扩展到训练链路
此次发布中,月之暗面不仅开放 Kimi K3 模型权重和技术报告,还公布了三项支撑训练的基础设施技术:MoonEP、FlashKDA 和 AgentEnv。来源显示,这三项技术覆盖高性能通信、高性能算子到分布式强化学习环境的关键链路。其中 FlashKDA 此前已经开源,MoonEP 和 AgentEnv 则随本次发布正式开源。
这部分对 AI 开源生态的意义不低于模型本身。当前大模型训练越来越依赖系统工程能力,包括分布式通信效率、算子性能、显存管理、并行策略以及强化学习环境搭建。仅开放模型权重,可以帮助开发者部署和微调;但如果训练 Infra 也开放,则更有利于研究者复现实验、优化训练方案,并推动围绕大模型训练系统的二次创新。
从产业角度看,开源 Infra 有助于降低大模型研发的“黑箱程度”。尤其是在 MoE、长上下文和多模态能力持续叠加后,模型性能提升不再只取决于数据和参数,训练框架、通信策略和算子实现同样会决定成本与效率。月之暗面将这些组件同步开放,可能会吸引更多开发者围绕 Kimi K3 进行适配、评测和工程化落地。
影响与解读:开源大模型竞争进入“规模+系统能力”阶段
来源提到,月之暗面此前表示,Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但在整套评测中展现出前沿水平能力,并稳定超过其他所有模型。由于相关结论来自官方表述,仍需等待更多第三方评测和真实应用反馈验证。不过,Kimi K3 的发布已经释放出一个明确信号:开源模型竞争正在从单项榜单分数,转向规模、上下文、多模态、Agent 能力与训练系统的综合较量。
对中文开发者而言,Kimi K3 的开源可能带来几类直接影响:一是为长上下文中文应用、代码助手和企业知识库提供新的模型选择;二是推动围绕 Moonshot 生态的工具链适配;三是让更多团队关注 MoE 与高效训练 Infra 在实际业务中的价值。尤其是在自动化软件工程和视觉辅助开发场景中,Kimi K3 若能在部署成本、响应速度和工具调用稳定性上进一步优化,将具备较强的应用想象空间。
总体来看,Kimi K3 是月之暗面在开源大模型路线上的一次重要更新。它把 2.8 万亿参数、百万 token 上下文、视觉理解、MoE 稀疏激活与训练 Infra 开源放在同一次发布中,体现了国内大模型公司在基础模型与系统工程两条线上同步推进的趋势。接下来,开发者社区的实际评测、推理成本、微调生态和 Agent 框架适配情况,将决定 Kimi K3 能否从“高规格开源模型”进一步走向广泛落地。