人工智能

月之暗面推出开源模型 Kimi K3:2.8 万亿参数、100 万 Token 上下文并原生支持视觉理解

2026年7月17日 · admin
openmagic ad

据 36 氪消息,月之暗面于 7 月 17 日正式推出开源模型 Kimi K3。来源显示,Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)与注意力残差(Attention Residuals)等技术构建,原生支持视觉理解,并具备 100 万 token 上下文窗口。按照月之暗面此次释放的信息,Kimi K3 面向长程编程、知识工作、推理等前沿智能场景,被定位为全球首个开源的 3 万亿级别模型。

开源 3 万亿级模型:Kimi K3 的核心信息

从公开摘要看,Kimi K3 最受关注的标签有三个:超大参数规模、长上下文能力,以及多模态视觉理解。2.8 万亿参数意味着它已经进入超大规模基础模型区间;100 万 token 上下文窗口则延续了月之暗面在长文本处理方向上的产品认知,让模型有机会处理更长的代码库、文档集合、研究材料或复杂任务链。

技术层面,Kimi K3 使用 KDA 混合线性注意力机制和 Attention Residuals。来源并未展开具体实现细节,但从命名和模型能力指向看,这类设计显然服务于更长上下文、更高效的信息处理和复杂推理稳定性。对于中文 AI 开发者和企业用户而言,真正值得关注的并不只是参数规模,而是这些技术能否在实际任务中带来可验证的吞吐、成本和效果改善。

  • 参数规模:2.8 万亿参数,官方定位接近 3 万亿级别。
  • 上下文能力:原生支持 100 万 token 上下文窗口,适合长文档和长程任务。
  • 模态能力:原生支持视觉理解,可覆盖图文结合类任务。
  • 应用方向:面向长程编程、知识工作与推理等智能场景。
  • 开放属性:据报道为全球首个开源的 3 万亿级别模型。

为什么长上下文和视觉理解是关键卖点

过去一年,大模型能力竞争从单纯比拼聊天体验,逐渐转向更复杂的生产力场景。对于知识工作者而言,模型能不能一次性读入大量资料、保持跨章节一致性、在长任务中不丢失关键信息,直接决定了它是否能从“问答工具”升级为“工作代理”。Kimi K3 的 100 万 token 上下文窗口,正是瞄准这类长程知识处理需求。

在编程场景中,长上下文也具备现实价值。大型工程往往涉及多个文件、依赖关系和历史修改记录。如果模型只能看到局部代码,就容易给出短视建议;如果能处理更长上下文,则更可能理解项目结构、定位跨文件问题,并参与复杂重构或测试生成。不过,长上下文并不自动等于高质量编程能力,仍需要看模型在代码理解、工具调用、推理链路和执行反馈中的综合表现。

视觉理解的加入,则让 Kimi K3 不再只是文本模型。对于企业知识库、软件界面理解、图表分析、设计稿说明、文档截图处理等场景,多模态能力正在成为基础模型的重要入口。尤其在办公自动化和研发协作中,图文混合信息非常常见,模型若能同时理解文本与图像,将更适合承担真实工作流中的中间环节。

对开源生态与国产模型竞争的影响

Kimi K3 选择开源,可能会进一步推高国内外开源大模型竞争门槛。此前,开源社区已经围绕模型尺寸、推理效率、上下文长度、Agent 能力和多模态能力形成快速迭代。此次月之暗面将 2.8 万亿参数级模型推向开源语境,意味着开发者、研究机构和企业将有机会围绕超大规模模型展开评测、适配和二次开发。

但对使用者来说,超大参数模型也意味着更高的部署与推理要求。即便模型开源,算力、显存、推理框架、量化方案、服务稳定性和成本控制仍是落地关键。对于多数企业和开发者而言,Kimi K3 的直接价值可能首先体现在能力基准、API 或托管服务体验上,而不是立即本地部署完整模型。

总体来看,Kimi K3 的发布显示,国产大模型厂商正在把竞争从通用聊天产品推进到长上下文、多模态、复杂推理与开源生态的组合战。接下来,外界更关心的将是模型权重开放方式、许可证细节、实际评测结果,以及在编程、知识管理和企业自动化场景中的真实表现。