DeepSeek V4.1 Flash 上线:基准测试里的进步,以及它仍落后 V4 Pro 的地方
9 月 10 日,DeepSeek 发布 V4.1 Flash,同时给出一个不常见的说法:新架构家族里最小的模型,能力超过自家的旗舰。官方称 V4.1 Flash 在性能、费用、速度、总用时等指标上全面超过 V4 Pro,并且已经按这个判断行动——北京时间 9 月 14 日 12:00 之后,请求 deepseek-v4-pro 会全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费,直到 V4.1 Pro 上线。V4 Flash 与 V4 Flash Vision Exp 已经下线,旧模型名出于兼容考虑临时指向新模型。
一家公司这样评价自己的旗舰系列,分量不轻。但它是自家测出来的结论,值得把「官方测了什么」和「外部测到了什么」分开看。
发布了什么
V4.1 Flash 是 552B 参数的 MoE 模型,采用新的 Causal Encoder-Decoder 结构,输入输出不对称:处理输入时激活 8B 参数,生成输出时激活 16B。官方把它定位成新的基础模型,而不是 V4 Flash 的小版本更新——从零开始的多模态预训练用了 45 万亿 token,稀疏注意力在 64K 上下文上训练、再扩展到 1M,后训练阶段的强化学习规模也比上一代更大。
模型卡与发布说明里的其他要点:
- 原生多模态输入。视觉编码器从预训练阶段就与语言模型联合训练,而不是事后拼接。
- 1M token 上下文,
reasoning_effort参数可在 1 到 100 之间调节。 - 权重以 MIT 协议开源在 Hugging Face,并附技术报告。官方在征集大规模部署合作,提到需要 2000 卡 GPU 加存储集群这一量级。
- 腾讯 WorkBuddy、CodeBuddy 与 OpenCode 作为官方合作伙伴完成接入。
缓存上的改动影响面最广
官方架构说明花在内存上的篇幅比花在分数上的更多,而对 agent 场景来说,钱就花在这里。解码器不再为每层保留全局 KV,而是复用编码器的最终隐状态;滑动窗口状态缺失时从最近的窗口重建,不再落盘持久化;FP4 KV 缓存把全局存储压到约 890 字节/token。相比 V4 Flash,官方称对 HBM 的需求降到 1/4、SSD 存储降到 1/8,KV Cache 相比初代模型缩小了 437 倍。
缓存体积重要,是因为在长时运行的 agent 里,缓存命中的费用占比往往最高。北京时间 9 月 10 日 12:00 生效的新价格直接体现了这一点:空闲时段缓存命中 0.02 元/百万 token、缓存未命中 1 元、输出 4 元,高峰时段翻倍,周末按空闲计费;报道的美元价约为每百万 token 0.003、0.15 和 0.60 美元。定价决策的来龙去脉我们在另一篇里写过;今天新增的事实是,这套价格现在对应的是一个同时开源权重的模型。
基准测试的结果
官方图表给出 V4 Flash 到 V4.1 Flash 的 agent 类提升,测试采用最大思考强度、temperature 1.0:
| 评测项 | V4 Flash | V4.1 Flash |
|---|---|---|
| Terminal-Bench 2.1(Pass@1) | 82.7% | 90.6% |
| DeepSWE v1.1(resolved) | 54.4% | 74.2% |
| CyberGym(Pass@1) | 76.7% | 88.1% |
| AutomationBench(Pass@1) | 37.7% | 54.8% |
| HLE(带工具,Pass@1) | 51.5% | 63.9% |
读这些数字需要知道它们是怎么测出来的:代码类结果用的是 DeepSeek 自家的极简版 DeepSeek Harness 框架、1M 上下文;视觉类任务用的是 Claude Code、512K 上下文。这些选择本身没问题,但意味着分数里包含框架,而不只是模型。
目前的外部结果方向一致但幅度不一。一次 BridgeBench 测试在单个任务上消耗了 2350 万 token,速度 344 token/秒,花费 0.33 美元——这既说明吞吐,也说明在这个价位上一场长 agent 会话能有多便宜。另一次冻结的视觉对比从 4 项任务完成 0 项变成完成 3 项。某安全方向的厂商评估报告工具调用次数从每轮 1.70 提升到 1.79,并称初始范围为空时模型的持续性更好。
它落后于 V4 Pro 的地方
同一张官方表格里,V4.1 Flash 在若干基础模型评测上不如 V4 Pro:
| 评测项 | V4 Pro | V4.1 Flash |
|---|---|---|
| SimpleQA-Verified | 55.2% | 42.3% |
| LongBench-V2 | 51.5% | 45.2% |
| HLE(不带工具) | 42.7% | 36.8% |
这个分布与架构选择吻合:奖励长工具链轨迹的 agent 任务表现突出,而事实记忆、不借助工具的长文档推理、知识密集型问答表现偏弱。官方把这些标注为基础模型评测、内部同口径测得,所以它们是自家数据,不是外部结论。但它们毕竟是官方自己公布的,对负载偏知识型而非 agent 型的团队来说,这些数字有实际意义——V4 Pro 的退场对这部分用户是一次有代价的迁移。
第三方结果的离散度也比官方图表更大。一份工程评估报告称,同一模型切到 DeepSeek Harness 后分数下降 16.77 分,功能正确性为 78,而对比的 Qwen 3.8 Flash 为 82。这种量级的框架敏感性不是这次发布独有的现象,但它提醒一件事:框架、上下文预算和思考强度,都是测量结果的一部分。
可以从中得到什么
「更小更便宜的模型超过更大的旗舰」在 DeepSeek 优化的那类负载上是可信的,也就是 agent 类负载。Terminal-Bench、AutomationBench 这类任务集和 DeepSWE 更看重持续的工具使用与长程执行,而不是存储的知识,而输入输出不对称、激活参数很少的编码器—解码器结构,是用较低成本服务这类负载的合理解法。缓存压缩指向同一个方向:它降低的是 agent 实际使用的那种会话长度的成本。
已经在用 V4 Flash 的团队,迁移基本是机械操作,兼容路由也留出了测试时间。把 V4 Pro 用在知识密集型任务上的团队,9 月 14 日的改路由是强制变更,上面的数字说明评估应该做在切换之前,而不是之后。对所有人来说都一样:模型卡是厂商自己的仪器,真正算数的测量,是在你自己的框架、你自己的上下文长度、你自己的任务上跑出来的那一次。
接下来值得盯两件事:独立评测能否在 DeepSeek 自家框架之外复现这次 agent 类提升;以及 V4.1 Pro 是否能补上公司刚刚自己公布的那块知识类差距。