晟安观点 · AI 算力
DeepSeek V4.1:旗舰被自己的廉价版下线,这笔账要按价目表算
市场在传 DeepSeek 最新的 V4.1「只用 1/4 的 HBM、1/8 的内存就能达到同样效果」。这个具体的硬件比值,我们没能证实——DeepSeek 官方从未公布过任何显存占用指标。但在核查过程中我们找到了一件更硬、也更重要的事:DeepSeek 已官宣于 2026 年 9 月 14 日 12:00 下线自家旗舰 V4 Pro,理由是廉价版 V4.1-Flash 在性能、费用、速度、总用时上「已全面超越」它。官方价目表显示,同一家厂商的新旧两代之间,缓存命中输入价差 7.5 倍、输出价差 3.4 倍、并发上限差 5 倍。这才是可以下注的数字。
一、事实
先把可核验的和不可核验的分开——这决定了后面所有判断的成色。
1. 可核验:官方已宣布下线旗舰
来源:DeepSeek API 官方文档「模型 & 价格」页(2026-09-11 核查)。官方原文:
经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro, 因此我们计划有序下线 V4 Pro。北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前,您访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash, 并按 V4.1 Flash 价格计费。
同时,旧模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 对应的模型已经下线,请求由 V4.1-Flash 承接。现役入口只剩 deepseek-flash 一个。
2. 可核验:官方价目表(元 / 百万 tokens)
| 项目 | deepseek-flash (V4.1-Flash) | deepseek-v4-pro (V4-Pro-0813) | 倍数 |
|---|---|---|---|
| 输入·缓存命中 (空闲/高峰) | 0.02 / 0.04 | 0.15 / 0.30 | 7.5× |
| 输入·缓存未命中 (空闲/高峰) | 1 / 2 | 4.5 / 9.0 | 4.5× |
| 输出 (空闲/高峰) | 4 / 8 | 13.5 / 27.0 | 3.4× |
| 并发限制 | 2500 | 500 | 5× |
| 上下文长度 | 1M | 1M | — |
| 输出长度 | 最大 384K | 最大 384K | — |
| 图像理解 | 支持 | 不支持 | — |
空闲时段价格为高峰时段的一半;高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00。
注意最后两行:更便宜的那个,上下文一样长,而且多了旗舰没有的图像理解能力。这不是"阉割版降价",是"新代际全面替代"。
3. 可核验:省显存的四层技术栈
「1/4 HBM」的说法虽无出处,但降显存的机制是公开且可查的,DeepSeek 把它们全部开源了:
- MLA:多头潜在注意力。多个逻辑查询头共用一条压缩的 latent KV 流,直接砍 KV cache。开源仓库 FlashMLA 现有 1.29 万 stars,2026-09-10 仍在推送
- DSA:DeepSeek 稀疏注意力。官方称"首次实现细粒度稀疏注意力,在长上下文训练与推理效率上大幅改善,同时保持输出质量几乎不变"。配套算子库 DeepSelect(TopK kernels)2026-09-09 才建仓
- Engram:条件记忆。用确定性寻址实现 O(1) 查表,论文明确写道「可将巨型 embedding 表卸载到主机内存,推理开销极小」——这是把重量从 HBM 挪走的正解
- mHC:四流残差通路。第三方实测(arXiv 2609.05309)确认 V4-Flash 采用四流架构
配套基础设施 DeepEP、DeepGEMM、FlashMLA、DeepJIT、DeepSelect、deepseek-recipe、deepseek-harness 在 2026-09-10 至 09-11 集中推送——这是大版本上线前后的典型节奏。
4. 可核验:第三方实测,不是厂商自说自话
- arXiv 2609.07008(RedKnot-MLA,2026-09-07):V4-Flash 为 37 个可复用层、56/8 的 Local/Global 头切分;Pro-0813 为 55 层、112/16 头。热工件首 token 延迟加速 2.02–3.84 倍,256K 长文下主算子算术量节省 78.7–79.5%
- arXiv 2609.07134(CCL2026-Eval 任务五):基于 V4-Flash 的系统总分 0.499 排名第一,超过由 GPT-5.5 驱动的官方基线 0.448,相对提升 11.4%
- arXiv 2609.10057:在 V4 上做 RISC-V 安全断言自动翻译,无人工干预下接受率 78%
5. 不可核验:那个「1/4 与 1/8」
我们做了完整检索:DeepSeek 官方文档与官网无任何 HBM 或显存占用披露;GitHub 上不存在 DeepSeek-V4 或 V4.1 的模型仓库(最新模型仓库仍停在 DeepSeek-V3.2-Exp、Math-V2、OCR-2、Prover-V2);arXiv 全库以 "V4.1" + DeepSeek 检索零命中。
晟安的态度:这个数字目前是无法溯源的市场传闻,我们不引用它,也建议读者不要拿它去做任何测算。但我们要指出一件事——价目表比传闻更可信,而且说得更狠。缓存命中输入价 1/7.5 这个比值,本身就落在传闻所说的「1/8」附近,而它是厂商用真金白银公开承诺的边际成本,不是匿名的硬件指标。想知道显存省了多少,看价格表和并发上限,比看传闻靠谱。
二、晟安视角
1. 真正的新闻不是「省显存」,是「参数规模不再是护城河」
一家头部厂商公开宣布下线自己的旗舰,理由是自家廉价版全面超越——这在大模型商业史上是罕见的。它传递的信息比任何 benchmark 都直接。
晟安的判断:过去三年,AI 行业的估值逻辑建立在一个隐含假设上——能力正比于参数规模,参数规模正比于算力投入,因此算力投入是护城河。V4.1 把这条链子从中间打断了:架构效率的提升,可以让小模型在同一时间点上全面压过大模型。护城河从"你买了多少卡"变成了"你每张卡上跑出多少智能"。这不是渐进变化,这是估值锚的更换。我们认为市场对这一点的定价严重不足。
2. 对算力硬件:不要做空 HBM,但要重排顺序
市场的第一反应通常是"省显存 = 利空 HBM = 利空存储链"。
晟安的观点(与市场直觉不同):我们不做空存储链,一分钱都不做空。理由是杰文斯悖论——单位智能的显存需求下降,会被需求总量的爆发覆盖掉。2500 的并发上限、1M 的上下文、0.02 元的缓存命中价,会把过去因成本被压抑的场景一次性放出来:全库级检索、长文档 Agent、7×24 小时后台任务、以及最关键的——中小企业第一次能负担得起大模型。总需求大概率上升。
但结构会变,这才是要做的动作。Engram 那条"把巨型 embedding 表卸载到主机内存"是我们最看重的技术信号:它意味着推理系统的瓶颈正在从 HBM 容量向主机内存带宽、高速互连、存算调度迁移。晟安在算力硬件方向上的关注权重,从本季度起按这个顺序重排:互连 > 主机侧内存 / CXL > HBM 容量弹性。这不是看空谁,是排序问题。
3. 对一级市场:我们的尽调问题变了
晟安的决定(即刻生效):过去两年,"我们训练了一个 XX B 参数的模型"是 AI 项目融资 PPT 的第一页。从今天起,这一页在晟安这里作废。我们对 AI 项目只问三个问题:(1)你单位任务的推理成本是多少?(2)这个数字过去 6 个月降了多少?(3)降本来自你自己的架构,还是来自上游厂商降价?第三个问题答不上来的,我们不投。因为那不是你的能力,那是 DeepSeek 的能力,而它随时可以通过调价把它收回去。
4. 对被投企业:成本假设现在全部过期
这一条我们已经在执行。9 月 14 日之后,同样一个 API 名字,价格降到原来的 1/3 到 1/7.5。这意味着:
- 任何在 2026 年上半年做的 AI 业务模型,成本侧假设已经全部过时
- 过去因为"单次调用太贵"而砍掉的产品功能,现在要重新拿出来算一遍
- 反过来,如果一家公司的护城河是"我们把推理成本压到了行业一半",这条护城河刚刚被上游填平了
晟安的提醒:第三条是真正危险的一条。上游降价对应用层是双刃剑——它降低你的成本,也降低你所有竞争对手的成本,同时抹平你在工程优化上的历史积累。成本优势不是护城河,只有分发、数据与工作流嵌入才是。这句话我们两年前就在说,V4.1 只是把它变成了紧急事项。
三、行动线
晟安已经在做的:
- 重算组合内 AI 应用层企业的毛利模型——用 9 月 14 日后的新价目表压测,重点看那些毛利依赖"低推理成本"的标的
- 调整算力硬件方向的关注排序——互连、主机侧内存、存算调度的权重上调,HBM 容量弹性的权重下调(注意:是下调排序,不是看空)
- 在新项目尽调清单中加入「推理成本下降曲线」——要求被投方拆出架构自研贡献与上游降价贡献
晟安选择不做的:
- 不做空存储链、不做空算力——杰文斯悖论下总需求上升,做空是拿方向赌结构
- 不参与 9 月 14 日前后的消息面博弈——这是二级市场短线的事,与我们的持有期无关
- 不投只有参数规模叙事的模型层项目——这条从今天起是硬性标准,不是倾向性
四、关于晟安
晟安投资(惠州)有限公司是一家业务覆盖全国的综合性投资机构,聚焦科技企业,业务涵盖私募股权投资、证券投资、资产管理与投资咨询。本次技术变化对晟安的影响主要落在两条线:
- 已投企业侧:AI 应用层被投企业的成本结构出现一次性改善窗口,我们正在逐一重算并推动产品侧的功能回补
- 投资决策侧:AI 方向的估值锚从"参数与算力投入"切换到"单位任务推理成本及其下降来源",尽调标准同步更新