人工智能

DeepSeek 明日下调 Flash 系列价格:输出降至每百万 Token 4 元,视觉实验模型同步调整

2026年9月9日 · admin
OpenMagic API

据 DeepSeek 开放平台公告,DeepSeek 将于北京时间 2026 年 9 月 10 日 12 时起执行 Flash 系列模型新价格。此次调整覆盖 deepseek-v4-flashdeepseek-v4-flash-vision-exp 两款模型,主要下调输入与输出 Token 计费标准。其中,空闲时段输出价格将调整为每百万 Token 4 元,高峰时段则为每百万 Token 8 元。对于正在使用 DeepSeek API 构建文本生成、智能客服、内容处理或多模态应用的开发者来说,这次降价将直接影响推理成本测算。

Flash 系列价格怎么变:缓存命中降幅最大

根据来源显示,DeepSeek Flash 系列新价格采用空闲时段与高峰时段区分计费,高峰时段各项价格为对应空闲时段的两倍。此次调整后,输入缓存命中价格在空闲时段从每百万 Token 0.05 元降至 0.02 元,高峰时段从 0.10 元降至 0.04 元,降幅为 60%。这意味着对于具备重复上下文、固定提示词或模板化调用的应用,若能有效利用缓存,单位调用成本将有更明显下降。

输入缓存未命中价格也同步下调:空闲时段从每百万 Token 1.5 元调整为 1 元,高峰时段从 3 元调整为 2 元,降幅为 33.33%。输出价格方面,空闲时段从每百万 Token 4.5 元降至 4 元,高峰时段从 9 元降至 8 元,降幅为 11.11%。整体来看,DeepSeek 本次更明显地压低了输入端成本,尤其是缓存命中场景。

  • 执行时间:北京时间 2026 年 9 月 10 日 12 时起。
  • 覆盖模型:deepseek-v4-flash、deepseek-v4-flash-vision-exp。
  • 空闲时段新价:缓存命中输入每百万 Token 0.02 元,缓存未命中输入每百万 Token 1 元,输出每百万 Token 4 元。
  • 高峰时段新价:各项价格均为空闲时段的两倍。
  • 主要降幅:缓存命中输入降 60%,缓存未命中输入降 33.33%,输出降 11.11%。

涉及文本与视觉实验模型,适合高频推理场景

公开资料显示,Flash 系列目前包括 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 两款模型。从命名来看,前者面向更通用的快速推理任务,后者则带有 vision 与 exp 标识,意味着它与视觉能力和实验性功能相关。此次两款模型同步降价,说明 DeepSeek 不只是压低文本模型成本,也在对包含视觉能力的模型进行价格优化。

对于开发者而言,Flash 系列通常更适合对响应速度、调用频率和成本敏感的业务,比如批量文本摘要、搜索问答增强、对话机器人、文档处理、轻量级智能体任务,以及部分图文理解或视觉辅助流程。价格降低后,这类应用在扩大调用量时的边际成本会有所改善,尤其是输入内容较长、提示词复用率较高的场景。

影响解读:API 价格竞争继续向“可规模化使用”推进

大模型 API 的成本结构通常由输入、输出、缓存、峰谷时段等因素共同决定。DeepSeek 此次调整的一个关键信号在于:模型服务商正在通过更细分的计费方式,引导开发者优化调用结构。缓存命中价格大幅下降,会鼓励应用方将系统提示词、固定上下文、知识库片段等内容做更好的复用设计,从而减少重复计算成本。

从产业角度看,Flash 系列降价也反映出大模型推理服务正在进入更强调性价比的阶段。相比单纯展示模型能力,价格、稳定性、延迟和开发者生态正在成为平台竞争的核心变量。对于中小团队和独立开发者来说,每百万 Token 单价的下降会降低试错门槛,使更多 AI 工具、自动化工作流和行业应用可以以较低成本上线验证。

不过,开发者在评估实际成本时仍需结合业务调用习惯。比如高峰与空闲时段价格不同,输出 Token 占比高的长文本生成应用与输入 Token 占比高的文档分析应用,成本变化并不完全相同。若业务可以安排在空闲时段批处理,或通过缓存机制提升命中率,实际节省空间会更加明显。

开发者应关注缓存策略与调用时段

此次价格调整后,Flash 系列的成本优化重点并不只在“单价更低”,更在于开发者能否把新计费规则转化为架构收益。对于需要长期调用 DeepSeek API 的团队,可以重新检查提示词设计、上下文拼接、任务拆分和调用时间安排,判断是否有进一步优化空间。

总体来看,DeepSeek 将 Flash 系列输出价格下调至空闲时段每百万 Token 4 元,并同步降低输入价格,是一次面向高频推理和工具化应用的定价调整。随着 AI 应用从演示走向常态化使用,推理成本下降将继续推动大模型更深入地进入办公、内容生产、软件开发和自动化流程