月 10 日,DeepSeek 发布 V4.1 Flash,同时给出一个不常见的说法:新架构家族里最小的模型,能力超过自家的旗舰。官方称 V4.1 Flash 在性能、费用、速度、总用时等指标上全面超过 V4 Pro,并且已经按这个判断行动——北京时间 9 月 14 日 12:00 之后,请求 `deepseek-v4-pro` 会全部路由到 V4.1 Flash,并按 V4.1 Flash">

DeepSeek V4.1 Flash 上线:基准测试里的进步,以及它仍落后 V4 Pro 的地方

September 10, 2026 共 1,631 字 阅读约 7 分钟

9 月 10 日,DeepSeek 发布 V4.1 Flash,同时给出一个不常见的说法:新架构家族里最小的模型,能力超过自家的旗舰。官方称 V4.1 Flash 在性能、费用、速度、总用时等指标上全面超过 V4 Pro,并且已经按这个判断行动——北京时间 9 月 14 日 12:00 之后,请求 deepseek-v4-pro 会全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费,直到 V4.1 Pro 上线。V4 Flash 与 V4 Flash Vision Exp 已经下线,旧模型名出于兼容考虑临时指向新模型。

一家公司这样评价自己的旗舰系列,分量不轻。但它是自家测出来的结论,值得把「官方测了什么」和「外部测到了什么」分开看。

发布了什么

V4.1 Flash 是 552B 参数的 MoE 模型,采用新的 Causal Encoder-Decoder 结构,输入输出不对称:处理输入时激活 8B 参数,生成输出时激活 16B。官方把它定位成新的基础模型,而不是 V4 Flash 的小版本更新——从零开始的多模态预训练用了 45 万亿 token,稀疏注意力在 64K 上下文上训练、再扩展到 1M,后训练阶段的强化学习规模也比上一代更大。

模型卡与发布说明里的其他要点:

  • 原生多模态输入。视觉编码器从预训练阶段就与语言模型联合训练,而不是事后拼接。
  • 1M token 上下文,reasoning_effort 参数可在 1 到 100 之间调节。
  • 权重以 MIT 协议开源在 Hugging Face,并附技术报告。官方在征集大规模部署合作,提到需要 2000 卡 GPU 加存储集群这一量级。
  • 腾讯 WorkBuddy、CodeBuddy 与 OpenCode 作为官方合作伙伴完成接入。

缓存上的改动影响面最广

官方架构说明花在内存上的篇幅比花在分数上的更多,而对 agent 场景来说,钱就花在这里。解码器不再为每层保留全局 KV,而是复用编码器的最终隐状态;滑动窗口状态缺失时从最近的窗口重建,不再落盘持久化;FP4 KV 缓存把全局存储压到约 890 字节/token。相比 V4 Flash,官方称对 HBM 的需求降到 1/4、SSD 存储降到 1/8,KV Cache 相比初代模型缩小了 437 倍。

缓存体积重要,是因为在长时运行的 agent 里,缓存命中的费用占比往往最高。北京时间 9 月 10 日 12:00 生效的新价格直接体现了这一点:空闲时段缓存命中 0.02 元/百万 token、缓存未命中 1 元、输出 4 元,高峰时段翻倍,周末按空闲计费;报道的美元价约为每百万 token 0.003、0.15 和 0.60 美元。定价决策的来龙去脉我们在另一篇里写过;今天新增的事实是,这套价格现在对应的是一个同时开源权重的模型。

基准测试的结果

官方图表给出 V4 Flash 到 V4.1 Flash 的 agent 类提升,测试采用最大思考强度、temperature 1.0:

评测项 V4 Flash V4.1 Flash
Terminal-Bench 2.1(Pass@1) 82.7% 90.6%
DeepSWE v1.1(resolved) 54.4% 74.2%
CyberGym(Pass@1) 76.7% 88.1%
AutomationBench(Pass@1) 37.7% 54.8%
HLE(带工具,Pass@1) 51.5% 63.9%

读这些数字需要知道它们是怎么测出来的:代码类结果用的是 DeepSeek 自家的极简版 DeepSeek Harness 框架、1M 上下文;视觉类任务用的是 Claude Code、512K 上下文。这些选择本身没问题,但意味着分数里包含框架,而不只是模型。

目前的外部结果方向一致但幅度不一。一次 BridgeBench 测试在单个任务上消耗了 2350 万 token,速度 344 token/秒,花费 0.33 美元——这既说明吞吐,也说明在这个价位上一场长 agent 会话能有多便宜。另一次冻结的视觉对比从 4 项任务完成 0 项变成完成 3 项。某安全方向的厂商评估报告工具调用次数从每轮 1.70 提升到 1.79,并称初始范围为空时模型的持续性更好。

它落后于 V4 Pro 的地方

同一张官方表格里,V4.1 Flash 在若干基础模型评测上不如 V4 Pro:

评测项 V4 Pro V4.1 Flash
SimpleQA-Verified 55.2% 42.3%
LongBench-V2 51.5% 45.2%
HLE(不带工具) 42.7% 36.8%

这个分布与架构选择吻合:奖励长工具链轨迹的 agent 任务表现突出,而事实记忆、不借助工具的长文档推理、知识密集型问答表现偏弱。官方把这些标注为基础模型评测、内部同口径测得,所以它们是自家数据,不是外部结论。但它们毕竟是官方自己公布的,对负载偏知识型而非 agent 型的团队来说,这些数字有实际意义——V4 Pro 的退场对这部分用户是一次有代价的迁移。

第三方结果的离散度也比官方图表更大。一份工程评估报告称,同一模型切到 DeepSeek Harness 后分数下降 16.77 分,功能正确性为 78,而对比的 Qwen 3.8 Flash 为 82。这种量级的框架敏感性不是这次发布独有的现象,但它提醒一件事:框架、上下文预算和思考强度,都是测量结果的一部分。

可以从中得到什么

「更小更便宜的模型超过更大的旗舰」在 DeepSeek 优化的那类负载上是可信的,也就是 agent 类负载。Terminal-Bench、AutomationBench 这类任务集和 DeepSWE 更看重持续的工具使用与长程执行,而不是存储的知识,而输入输出不对称、激活参数很少的编码器—解码器结构,是用较低成本服务这类负载的合理解法。缓存压缩指向同一个方向:它降低的是 agent 实际使用的那种会话长度的成本。

已经在用 V4 Flash 的团队,迁移基本是机械操作,兼容路由也留出了测试时间。把 V4 Pro 用在知识密集型任务上的团队,9 月 14 日的改路由是强制变更,上面的数字说明评估应该做在切换之前,而不是之后。对所有人来说都一样:模型卡是厂商自己的仪器,真正算数的测量,是在你自己的框架、你自己的上下文长度、你自己的任务上跑出来的那一次。

接下来值得盯两件事:独立评测能否在 DeepSeek 自家框架之外复现这次 agent 类提升;以及 V4.1 Pro 是否能补上公司刚刚自己公布的那块知识类差距。