智谱开源 GLM-5.3-Flash:320B 原生多模态模型上线,限时价格为 GLM-5.3 的 1/20
据 IT之家 8 月 26 日消息,智谱当晚上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型。该模型总参数量为 320B,激活参数为 18B,官方称其在能力上超过 GLM-5.2,并以匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter 上提前进行了大规模测试。来源显示,Ox-Alpha 在测试期间成为当周最受欢迎模型,并创下两个平台调用量新高,而相关请求流量全部由国产芯片算力承载。
此次发布的重点不只是“开源一个新模型”,而是智谱试图在前沿模型能力、低成本推理、国产算力适配和多模态工作流之间做一次集中展示。对于中文 AI 开发者和企业用户来说,GLM-5.3-Flash 的意义在于:一个更便宜、可开源部署、覆盖代码与视觉任务的模型,正在进入可实际试用和集成的阶段。
从 Ox-Alpha 到 GLM-5.3-Flash:匿名测试后正式亮相
在正式发布前,智谱将 GLM-5.3-Flash 以 Ox-Alpha 的匿名身份投放到 OpenCode 和 OpenRouter 进行测试。中文社区也将其称为“牛来”。来源显示,这一模型很快获得较高关注,并成为当周最受欢迎的模型之一。
匿名测试在大模型领域并不罕见,它可以在不预设品牌认知的情况下,让用户直接以输出质量、响应速度和工具适配能力进行判断。对模型厂商而言,这类测试也能收集来自真实开发者环境的大规模调用反馈,尤其适合验证代码生成、长上下文、多轮任务执行等复杂场景。
值得注意的是,来源称 Ox-Alpha 测试阶段的请求流量全部由国产芯片提供算力支持。若这一部署路径持续扩大,意味着国产模型与国产算力之间的协同正在从实验室指标走向公开服务场景,对国内 AI 基础设施生态具有观察价值。
核心参数与能力:320B 总参数、18B 激活参数
GLM-5.3-Flash 的模型规模为 320B,但激活参数仅 18B。按照官方介绍,这一设计目标是用更低计算资源实现更强性能。与 GLM-4.5 相比,其总参数量处于相近区间,但激活参数量从 32B 降至 18B,层数也从 92 降至 45。官方称,这些变化使模型在服务成本上更具优势。
来源显示,GLM-5.3-Flash 结合了 30T Token 多模态预训练语料,并进行了多项架构升级。官方称其是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,目标是在保留长上下文精度的同时降低长上下文服务成本。此外,该模型还采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC),用于提升模型 Scaling 能力。
- 模型定位:GLM-5 系列首个原生多模态模型。
- 参数规模:总参数量 320B,激活参数 18B。
- 测试代号:发布前以 Ox-Alpha 身份在 OpenCode 和 OpenRouter 测试。
- 能力表现:AA 综合智能指数取得 57 分,来源称进入全球前沿模型能力区间。
- 成本策略:定价为 GLM-5.3 的 1/10,限时折扣为 GLM-5.3 的 1/20。
编程、多模态与 Office 工作流是主要应用方向
从官方描述看,GLM-5.3-Flash 的多模态能力并非只停留在图像理解或视觉问答,而是被放入 Coding 循环之中。也就是说,模型可以在写代码的同时观察界面、渲染结果和交互反馈,再基于结果继续测试和修改。
这类能力对于前端开发、游戏构建、Blender 3D 场景生成等任务尤其关键。过去,代码模型通常只能根据文字描述生成代码,遇到 UI 偏差、渲染错误或交互问题时,需要人类开发者反复截图、描述和修正。若模型能够主动理解界面反馈,它就更接近“会看结果的代码助手”。
来源还提到,GLM-5.3-Flash 可用于 BUA、CUA 驱动的真实环境操作,并可在代码、浏览器和图形界面之间协同完成任务。这意味着智谱并不只把它定位为聊天模型,而是希望其成为能调用工具、执行任务、检查结果的自动化智能体基础模型。
在办公与行业场景方面,GLM-5.3-Flash 进一步覆盖 Office、金融研究和专业文档处理。官方称其可以拆解复杂目标,调用合适工具,检查并优化输出,完成从研究分析、模型构建到 PPTX、PDF、DOCX、XLSX 成品交付的完整流程。
影响与解读:低价前沿模型将加速“模型可用性”竞争
GLM-5.3-Flash 最具市场冲击力的部分是价格。来源显示,该模型定价为 GLM-5.3 的 1/10,限时折扣内为 GLM-5.3 的 1/20,并为 Opus 4.8 的 1/40。官方还表示,它在多项基准和实际使用中全面超过参数量更高的 GLM-5.2,但价格仅为后者的 1/10。
这反映出当前大模型竞争正在从单纯追求最大参数、最高榜单分数,转向“能力、成本、部署、工具链”的综合较量。对于开发者而言,一个模型即便不是所有榜单第一,只要在代码、文档、多模态和长上下文任务中足够稳定,同时 API 成本可控,就可能成为实际产品中的默认选择。
从产业角度看,智谱此次将 GLM-5.3-Flash 开源,并同步开放 API 调用,还接入 ZCode 等编码平台、纳入 GLM Coding Plan,说明其策略是同时服务研究社区、开发者工具和商业调用。来源显示,GLM Coding Plan 每天限量发放 10,000 张体验卡,且全员额度已重置,用户可在后台用量统计中查看额度恢复情况。
对于中文 AI 生态来说,GLM-5.3-Flash 的看点在于两点:一是原生多模态与代码执行场景结合,可能提高 AI 编程工具的可用性;二是低成本定价与国产算力支撑,可能推动更多企业把多模态模型接入内部工作流。后续仍需观察其开源权重的实际部署门槛、长上下文稳定性、复杂工具调用成功率,以及在真实业务场景中的成本表现。