DeepSeek 下调 Flash 系列价格,最高降 60%:真正的主角是缓存命中价

September 10, 2026 共 1,143 字 阅读约 5 分钟

涨价不到一个月,DeepSeek 又降价了。官方公告称:北京时间 2026 年 9 月 10 日 12:00 起,Flash 系列执行新价格,最高降幅 60%

新价格如下(空闲时段,高峰时段为其两倍):

计费项 调整前 调整后 降幅
输入(缓存命中) 0.05 元 / 百万 tokens 0.02 元 / 百万 tokens −60%
输入(缓存未命中) 1.5 元 / 百万 tokens 1.0 元 / 百万 tokens −33%
输出 4.5 元 / 百万 tokens 4.0 元 / 百万 tokens −11%

deepseek-v4-flashdeepseek-v4-flash-vision-exp 两款同价——视觉版继续按 Flash 计价、不收视觉附加费,和它 8 月上线时的口径一致(见当时那篇)。

60% 这个数字,本质是一次「缓存补贴」

把三行拆开看,意图非常清楚:

  • 缓存命中输入降 60%。 这是"模型已经看过"的 token 的价格——固定的系统提示词、代码库、反复发送的同一份文档。它变便宜了 2.5 倍。
  • 缓存未命中输入降 33%。 新内容依然要花钱,只是少花一点。
  • 输出只降 11%。 模型"写出来"的 token,价格几乎没动。

这个形状,等于对高复用型 agent 工作流定向打折:长系统提示词、重复的上下文、检索头、工具 schema、反复读同一段前缀的多轮会话。如果你的输入大部分能命中缓存,账单会有明显变化;如果你的账单主要在输出上,这次降价约等于零头。

峰谷机制没变,时间仍是杠杆

"什么时候跑"这件事没有任何变化:工作日 09:00–12:00 与 14:00–18:00(北京时间)为高峰、按空闲价的两倍计费,周末全天按空闲价(8 月 23 日起的调整,见「周末全天空闲价」那篇)。

两个杠杆叠加,表里最便宜的一格就出现了:周日的缓存命中输入是 0.02 元/百万 tokens;同样一个 token 放到周二上午 10 点,是 0.04 元,而它后面跟着的输出要按 8 元而不是 4 元算。

一个月之内的价格过山车

把几次动作排在一起,脉络很清楚:

  • 8 月中旬:峰谷定价上线,同时有报道称这轮调价中部分计费项涨幅最高达 1100%,当时的评论在问——梁文锋是不是不想当"价格屠夫"了
  • 8 月 23 日:周末并入空闲价。
  • 9 月 9 日公告、10 日 12:00 执行:Flash 系列最高降 60%。

合理的读法是:上一轮涨过头了,现在在回调——而且专挑新模型临门的时候回调。多家报道称 V4.1 Flash 计划 9 月 10 日前后发布、已开启内测,据称各项指标全面超越 V4 Pro。降价与新模型同周出现是很经典的一套组合拳:让新模型直接落在更便宜的计价器上,把"要不要升级"变成不需要犹豫的问题。同一周,DeepSeek 还启动了新一轮大规模招聘

开发者该怎么做

  1. 把缓存做到极致——它现在是你手上最有力的杠杆。 稳定的前缀、确定的系统提示词、不乱变的工具 schema:留在缓存里的每个 token 只要 0.02 元,而不是 1 元。过去对提示词稳定性不上心的团队,这次价格表会让你付出代价。
  2. 重算成本模型,因为比值变了。 缓存命中输入现在比输出便宜 200 倍(0.02 元 vs 4 元/百万 tokens)。上下文密集的 agent 是真降预算,输出密集的 agent 只降了个零头。两类都该重算,但只有一类值得庆祝。
  3. 按计价器排班。 批处理、回填、评测放到空闲时段和周末——同一份代码,一半价格。
  4. 别把身家押在一家的价格表上。 一个月之内先涨价、再降 60%,这就是"保留路由层"最有力的论据:按任务、价格和可用性在多家之间调度,而不是靠忠诚度。
  5. 盯着 V4.1 Flash。 如果它带着更好的基准落在新的 Flash 价位上,升级决策可能简单到不需要想。但它落地后先测一遍——别让一次降价替你做模型选型的决定。

结论

"最高降 60%"是真的,但它不是"模型便宜了 60%",而是"缓存便宜了 60%"。账单降得最多的,是那些反复读同一份上下文的 agent;降得最少的,是那些主要在写字的。先搞清楚自己属于哪一种,然后重跑一遍账:对合适的工作流来说,这已经是 Flash 有史以来最便宜的时刻。