← 返回观点列表

晟安观点 · AI 算力

DeepSeek V4.1:旗舰被自己的廉价版下线,这笔账要按价目表算

市场在传 DeepSeek 最新的 V4.1「只用 1/4 的 HBM、1/8 的内存就能达到同样效果」。这个具体的硬件比值,我们没能证实——DeepSeek 官方从未公布过任何显存占用指标。但在核查过程中我们找到了一件更硬、也更重要的事:DeepSeek 已官宣于 2026 年 9 月 14 日 12:00 下线自家旗舰 V4 Pro,理由是廉价版 V4.1-Flash 在性能、费用、速度、总用时上「已全面超越」它。官方价目表显示,同一家厂商的新旧两代之间,缓存命中输入价差 7.5 倍、输出价差 3.4 倍、并发上限差 5 倍。这才是可以下注的数字。

发布日期:2026-09-11 · 预计阅读 9 分钟 · 作者:晟安投资 研究部

一、事实

先把可核验的和不可核验的分开——这决定了后面所有判断的成色。

1. 可核验:官方已宣布下线旗舰

来源:DeepSeek API 官方文档「模型 & 价格」页(2026-09-11 核查)。官方原文:

经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,
因此我们计划有序下线 V4 Pro。北京时间 2026 年 9 月 14 日 12:00 之后,至未来
V4.1 Pro 上线之前,您访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,
并按 V4.1 Flash 价格计费。

同时,旧模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 对应的模型已经下线,请求由 V4.1-Flash 承接。现役入口只剩 deepseek-flash 一个。

2. 可核验:官方价目表(元 / 百万 tokens)

项目deepseek-flash
(V4.1-Flash)
deepseek-v4-pro
(V4-Pro-0813)
倍数
输入·缓存命中
(空闲/高峰)
0.02 / 0.040.15 / 0.307.5×
输入·缓存未命中
(空闲/高峰)
1 / 24.5 / 9.04.5×
输出
(空闲/高峰)
4 / 813.5 / 27.03.4×
并发限制25005005×
上下文长度1M1M—
输出长度最大 384K最大 384K—
图像理解支持不支持—

空闲时段价格为高峰时段的一半;高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00。

注意最后两行:更便宜的那个,上下文一样长,而且多了旗舰没有的图像理解能力。这不是"阉割版降价",是"新代际全面替代"。

3. 可核验:省显存的四层技术栈

「1/4 HBM」的说法虽无出处,但降显存的机制是公开且可查的,DeepSeek 把它们全部开源了:

配套基础设施 DeepEP、DeepGEMM、FlashMLA、DeepJIT、DeepSelect、deepseek-recipe、deepseek-harness 在 2026-09-10 至 09-11 集中推送——这是大版本上线前后的典型节奏。

4. 可核验:第三方实测,不是厂商自说自话

5. 不可核验:那个「1/4 与 1/8」

我们做了完整检索:DeepSeek 官方文档与官网无任何 HBM 或显存占用披露;GitHub 上不存在 DeepSeek-V4 或 V4.1 的模型仓库(最新模型仓库仍停在 DeepSeek-V3.2-Exp、Math-V2、OCR-2、Prover-V2);arXiv 全库以 "V4.1" + DeepSeek 检索零命中。

晟安的态度:这个数字目前是无法溯源的市场传闻,我们不引用它,也建议读者不要拿它去做任何测算。但我们要指出一件事——价目表比传闻更可信,而且说得更狠。缓存命中输入价 1/7.5 这个比值,本身就落在传闻所说的「1/8」附近,而它是厂商用真金白银公开承诺的边际成本,不是匿名的硬件指标。想知道显存省了多少,看价格表和并发上限,比看传闻靠谱。

二、晟安视角

1. 真正的新闻不是「省显存」,是「参数规模不再是护城河」

一家头部厂商公开宣布下线自己的旗舰,理由是自家廉价版全面超越——这在大模型商业史上是罕见的。它传递的信息比任何 benchmark 都直接。

晟安的判断:过去三年,AI 行业的估值逻辑建立在一个隐含假设上——能力正比于参数规模,参数规模正比于算力投入,因此算力投入是护城河。V4.1 把这条链子从中间打断了:架构效率的提升,可以让小模型在同一时间点上全面压过大模型。护城河从"你买了多少卡"变成了"你每张卡上跑出多少智能"。这不是渐进变化,这是估值锚的更换。我们认为市场对这一点的定价严重不足。

2. 对算力硬件:不要做空 HBM,但要重排顺序

市场的第一反应通常是"省显存 = 利空 HBM = 利空存储链"。

晟安的观点(与市场直觉不同):我们不做空存储链,一分钱都不做空。理由是杰文斯悖论——单位智能的显存需求下降,会被需求总量的爆发覆盖掉。2500 的并发上限、1M 的上下文、0.02 元的缓存命中价,会把过去因成本被压抑的场景一次性放出来:全库级检索、长文档 Agent、7×24 小时后台任务、以及最关键的——中小企业第一次能负担得起大模型。总需求大概率上升。

但结构会变,这才是要做的动作。Engram 那条"把巨型 embedding 表卸载到主机内存"是我们最看重的技术信号:它意味着推理系统的瓶颈正在从 HBM 容量向主机内存带宽、高速互连、存算调度迁移。晟安在算力硬件方向上的关注权重,从本季度起按这个顺序重排:互连 > 主机侧内存 / CXL > HBM 容量弹性。这不是看空谁,是排序问题。

3. 对一级市场:我们的尽调问题变了

晟安的决定(即刻生效):过去两年,"我们训练了一个 XX B 参数的模型"是 AI 项目融资 PPT 的第一页。从今天起,这一页在晟安这里作废。我们对 AI 项目只问三个问题:(1)你单位任务的推理成本是多少?(2)这个数字过去 6 个月降了多少?(3)降本来自你自己的架构,还是来自上游厂商降价?第三个问题答不上来的,我们不投。因为那不是你的能力,那是 DeepSeek 的能力,而它随时可以通过调价把它收回去。

4. 对被投企业:成本假设现在全部过期

这一条我们已经在执行。9 月 14 日之后,同样一个 API 名字,价格降到原来的 1/3 到 1/7.5。这意味着:

晟安的提醒:第三条是真正危险的一条。上游降价对应用层是双刃剑——它降低你的成本,也降低你所有竞争对手的成本,同时抹平你在工程优化上的历史积累。成本优势不是护城河,只有分发、数据与工作流嵌入才是。这句话我们两年前就在说,V4.1 只是把它变成了紧急事项。

三、行动线

晟安已经在做的:

  1. 重算组合内 AI 应用层企业的毛利模型——用 9 月 14 日后的新价目表压测,重点看那些毛利依赖"低推理成本"的标的
  2. 调整算力硬件方向的关注排序——互连、主机侧内存、存算调度的权重上调,HBM 容量弹性的权重下调(注意:是下调排序,不是看空)
  3. 在新项目尽调清单中加入「推理成本下降曲线」——要求被投方拆出架构自研贡献与上游降价贡献

晟安选择不做的:

四、关于晟安

晟安投资(惠州)有限公司是一家业务覆盖全国的综合性投资机构,聚焦科技企业,业务涵盖私募股权投资、证券投资、资产管理与投资咨询。本次技术变化对晟安的影响主要落在两条线: