DeepSeek 发布 V4.1 Flash:一个「小」模型,凭什么超越自家旗舰?
9 月 10 日,DeepSeek 正式发布新模型 V4.1 Flash。
这次发布有点不一样。作为 V4.1 系列中尺寸最小的模型,它在多项基准测试中却超越了自家更大的旗舰 V4 Pro——而且是「性能、费用、速度、总用时全面超越」。更耐人寻味的是 DeepSeek 的后续动作:干脆把 V4 Pro 下线了。
这是 DeepSeek 全新模型架构系列里最小的那个,但能力却不小。它的核心配置是:552B 总参数的 MoE(混合专家)模型,具备原生多模态视觉理解能力——不是外挂一个视觉模块,而是模型本身就「长着眼睛」。
而它最特别的地方,是采用了一种叫 Causal-Encoder-Decoder 的非对称结构:输入和输出不是一视同仁的——输入侧只激活 8B 参数,输出侧激活 16B 参数。
打个比方:过去的大模型像一个「全能选手」,无论读题还是答题都要调动全部脑力;而 V4.1 Flash 更像分工明确的「读题专家 + 答题专家」——读题时用较小的算力,答题时才加大投入。这样一来,成本自然就降下来了。
性能:小模型赢了大模型
这次发布最具话题性的,是 V4.1 Flash 对自家旗舰 V4 Pro 的「逆袭」。
从官方公布的基准测试看:
? GPQA Diamond(研究生级科学问答):90.9
? Codeforces(编程竞赛):39
? Terminal-Bench 2.1(终端操作任务):90.6
? DeepSWE v1.1(软件工程):74.2

(图片:来源为DeepSeek官网)
官方称,V4.1 Flash 在智能水平上超越了包括 V4 Pro 在内的一众旗舰模型,并与 Kimi K3、GLM 5.3、GPT-5.6-Sol、Claude Opus 5 等前沿模型进行了对标。
值得注意的是,这套新架构的设计初衷本就是「能力上限更高、推理更快、吞吐更大、可扩展到更大参数模型」。也就是说,Flash 只是这条新路线的「最小验证版」——更大的 V4.1 Pro 还在后面。
真正的杀手锏:KV Cache 缩小 437 倍
如果说性能超越 Pro 版是「面子」,那 KV Cache 的压缩才是「里子」。
先解释一下 KV Cache 是什么。大模型在生成回复时,需要「记住」前面聊过的内容,这份记忆就存在 KV Cache(键值缓存)里。对话越长、任务越复杂,这份缓存就越大,占用的显存和存储也越多。
而 V4.1 Flash 在这件事上做了惊人的优化:相比上一代,对 HBM(高带宽内存)的需求降到 1/4,对 SSD 的需求降到 1/8。而相对于初代模型,KV Cache 已经缩小了约 437 倍。
437 倍是什么概念?这意味着原本需要一整个机柜才能装下的缓存,现在可能一台设备就够了。对于动辄要跑几十轮、上百轮交互的 Agent(智能体)任务来说,这项优化的意义非常直接——缓存命中费用是 Agent 类应用的主要成本之一,压缩 KV Cache 就等于直接砍成本。

(图片:来源为DeepSeek官网)
价格:降价 60%,还搞峰谷分时
有了架构上的成本优势,DeepSeek 在定价上也毫不含糊。
新价格采用峰谷分时定价,闲时价格为高峰时段的一半。以每百万 token 计:

(图片:来源为DeepSeek官网)
其中,缓存命中的输入价格降幅高达 60%。高峰时段为北京时间周一至周五的 9:00-12:00 和 14:00-18:00,其余时间均为闲时。对于把 DeepSeek 用在生产环境的开发者来说,把任务安排在闲时跑,成本可以直接砍半。
V4 Pro 下线:一次果断的「自我革命」
这次发布最出人意料的,是 DeepSeek 对 V4 Pro 的处理。
官方公告称,由于 V4.1 Flash 在性能、费用、速度、总用时等指标上全面超越 V4 Pro,因此计划有序下线 V4 Pro:从 9 月 14 日 12:00 起,直到未来的 V4.1 Pro 上线之前,所有访问 deepseek-v4-pro 的请求都将被路由到 V4.1 Flash,并按 V4.1 Flash 的价格计费。
主动下线自家旗舰,这在模型厂商里并不常见。但对 DeepSeek 来说逻辑很清晰:既然小模型更快、更强、更便宜,那就没有必要让用户继续为「更大」付费。
「更小更强」取代「更大更强」,这或许是大模型行业的一个重要转折信号。
延续一贯的风格,DeepSeek 这次依然选择开源——模型权重与技术报告已在 HuggingFace 发布,官方还表示将支持开源社区适配新架构的推理。
生态方面,腾讯的 WorkBuddy、CodeBuddy 以及 OpenCode 已作为官方合作伙伴全量接入,其中 WorkBuddy 还提供为期两周的限时折扣。
把这次发布放在整个行业里看,DeepSeek 传递的信号很明确。
过去两年,大模型的竞争逻辑是「更大就是更强」——参数从百亿飙到万亿,算力投入不断加码。但 V4.1 Flash 给出了另一个答案:通过架构创新,小模型也能赢大模型,而且成本更低、速度更快。
这背后其实是一个更务实的转向——当模型能力逐渐「够用」,行业竞争的焦点就从「谁的模型更聪明」,转向了「谁能把成本做到最低、把效率做到最高」。毕竟对企业客户来说,能省钱、能跑得动、能大规模部署的模型,才是真正能用的模型。
对开发者来说,这大概是好消息:又便宜、又快、又强的模型,谁不喜欢呢?
数
