人工智能

阿里云百炼下调 GLM-5.2 Fast mode 价格:7 月 15 日起降价 20%

2026年7月15日 · admin
openmagic ad

据 IT之家消息,阿里云于 7 月 14 日宣布,其大模型服务平台百炼将从北京时间 2026 年 7 月 15 日 00:00:00 起,下调 GLM-5.2 模型 Fast mode 模式的计费单价,降幅为 20%。此次调整聚焦在特定模型、特定调用模式上,并非平台全线降价。对正在使用百炼调用第三方大模型、尤其关注响应速度与推理链路效率的开发者和企业来说,这一变化意味着相关高速推理场景的使用成本将有所降低。

Fast mode 面向速度敏感型 AI 应用

阿里云介绍,GLM-5.2 的快速模式(Fast mode)主要服务于对输出速度敏感的业务场景,例如 AI 流式编程助手、Agent 多步推理、实时对话等。这类应用通常要求模型尽快开始并持续输出内容,用户感知到的延迟会直接影响产品体验。

来源显示,Fast mode 当前仍处于 preview 阶段,相关能力与规格后续可能随着版本调整而变化。因此,对企业生产环境而言,降价虽然降低了测试和使用门槛,但在大规模上线前仍需要关注稳定性、限流策略、版本变动等因素。

  • 高速输出:Fast mode 的 TPS 可提升至标准 API 的 1.5 至 2 倍,达到 80 至 100 TPS。
  • 按 token 计费:计费逻辑与标准 API 保持一致,按输入和输出 token 计费。
  • 特殊限流:当请求超出 TPM 额度时,不会立即限流,而是进入排队队列。
  • 调用方式:调用时将 model 参数指定为支持模型的 model ID 即可开启,无需额外参数。

百炼继续强化多模型统一入口定位

阿里云百炼是一个面向开发者和企业的大模型服务平台,其特点是将多家厂商的大模型能力整合在统一入口中。除阿里自研的通义千问模型外,平台此前已接入智谱 GLM、MiniMax、月之暗面 Kimi 等第三方模型,为用户提供多模型选择和统一调用体验。

从这一背景看,GLM-5.2 Fast mode 降价并不只是单一模型价格变化,也反映出云厂商正在围绕“模型超市”和“推理服务平台”展开竞争。对于企业用户来说,选择模型时不再只比较模型能力本身,还会综合考虑调用成本、延迟表现、限流策略、平台稳定性以及与现有云资源的集成便利性。

影响解读:高速推理成本下降,有利于 Agent 与实时交互应用

此次 20% 降价的直接影响,是降低 GLM-5.2 Fast mode 在高频调用场景中的边际成本。对于 AI 编程助手、智能客服、语音或文本实时对话产品而言,模型输出速度和单位 token 成本往往同时决定产品能否规模化运行。更高 TPS 与更低单价的组合,可能会让开发者更愿意在需要快速响应的功能中尝试该模式。

Agent 应用也是受益方向之一。多步推理任务通常需要连续调用模型,单次延迟叠加后会放大用户等待时间。如果 Fast mode 能在实际业务中保持较高输出速度,将有助于改善任务规划、工具调用、代码生成等复杂链路的体验。不过,来源同时提示该模式仍为 preview 阶段,因此企业需要在成本下降之外,继续评估其在稳定性和版本兼容方面的风险。

值得注意的是,阿里云过去也曾进行过更大范围的云产品和模型服务降价。来源提到,2024 年底阿里云曾对通义千问视觉理解模型进行全线降价,降幅超过 80%;2023 年也曾对核心产品进行大规模价格调整,最高降幅达 50%。相比之下,本次 GLM-5.2 Fast mode 降价更像是一次精细化、场景化的价格策略调整,目标是提升特定高速推理能力的吸引力,而不是发动全面价格战。

总体来看,随着大模型平台从“能调用”进入“好用、便宜、稳定地调用”阶段,推理成本和响应速度正在成为模型服务竞争的关键指标。阿里云百炼此次下调 GLM-5.2 Fast mode 价格,或将进一步推动开发者在实时交互、Agent、多模型应用编排等方向进行更多试验。