# DeepSeek V4.1：旗舰被自己的廉价版下线，这笔账要按价目表算

> 晟安观点 · AI 算力 · 2026-09-11 · 预计阅读 9 分钟 · 作者：晟安投资 研究部

市场在传 DeepSeek 最新的 V4.1「只用 1/4 的 HBM、1/8 的内存就能达到同样效果」。**这个具体的硬件比值，我们没能证实**——DeepSeek 官方从未公布过任何显存占用指标。但在核查过程中我们找到了一件更硬、也更重要的事：**DeepSeek 已官宣于 2026 年 9 月 14 日 12:00 下线自家旗舰 V4 Pro，理由是廉价版 V4.1-Flash 在性能、费用、速度、总用时上「已全面超越」它**。官方价目表显示，同一家厂商的新旧两代之间，缓存命中输入价差 7.5 倍、输出价差 3.4 倍、并发上限差 5 倍。这才是可以下注的数字。

## 一、事实

先把可核验的和不可核验的分开——这决定了后面所有判断的成色。

### 1. 可核验：官方已宣布下线旗舰

来源：DeepSeek API 官方文档「模型 & 价格」页（2026-09-11 核查）。官方原文：

> 经多方测试，V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro，因此我们计划有序下线 V4 Pro。北京时间 2026 年 9 月 14 日 12:00 之后，至未来 V4.1 Pro 上线之前，您访问 `deepseek-v4-pro` 的请求将全部路由到 V4.1 Flash，并按 V4.1 Flash 价格计费。

同时，旧模型名 `deepseek-v4-flash`、`deepseek-v4-flash-vision-exp` 对应的模型**已经下线**，请求由 V4.1-Flash 承接。现役入口只剩 `deepseek-flash` 一个。

### 2. 可核验：官方价目表（元 / 百万 tokens）

| 项目 | deepseek-flash（V4.1-Flash） | deepseek-v4-pro（V4-Pro-0813） | 倍数 |
| --- | --- | --- | --- |
| 输入·缓存命中（空闲/高峰） | 0.02 / 0.04 | 0.15 / 0.30 | **7.5×** |
| 输入·缓存未命中（空闲/高峰） | 1 / 2 | 4.5 / 9.0 | **4.5×** |
| 输出（空闲/高峰） | 4 / 8 | 13.5 / 27.0 | **3.4×** |
| 并发限制 | 2500 | 500 | **5×** |
| 上下文长度 | 1M | 1M | — |
| 输出长度 | 最大 384K | 最大 384K | — |
| 图像理解 | 支持 | **不支持** | — |

空闲时段价格为高峰时段的一半；高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00。

**注意最后两行**：更便宜的那个，上下文一样长，而且多了旗舰没有的图像理解能力。这不是"阉割版降价"，是"新代际全面替代"。

### 3. 可核验：省显存的四层技术栈

「1/4 HBM」的说法虽无出处，但**降显存的机制是公开且可查的**，DeepSeek 把它们全部开源了：

- **MLA（多头潜在注意力）**：多个逻辑查询头共用一条压缩的 latent KV 流，直接砍 KV cache。开源仓库 FlashMLA 现有 1.29 万 stars，2026-09-10 仍在推送
- **DSA（DeepSeek 稀疏注意力）**：官方称"首次实现细粒度稀疏注意力，在长上下文训练与推理效率上大幅改善，同时保持输出质量几乎不变"。配套算子库 DeepSelect（TopK kernels）**2026-09-09 才建仓**
- **Engram（条件记忆）**：用确定性寻址实现 O(1) 查表，论文明确写道**「可将巨型 embedding 表卸载到主机内存，推理开销极小」**——这是把重量从 HBM 挪走的正解
- **mHC（四流残差通路）**：第三方实测（arXiv 2609.05309）确认 V4-Flash 采用四流架构

配套基础设施 DeepEP、DeepGEMM、FlashMLA、DeepJIT、DeepSelect、deepseek-recipe、deepseek-harness 在 2026-09-10 至 09-11 集中推送——这是大版本上线前后的典型节奏。

### 4. 可核验：第三方实测，不是厂商自说自话

- **arXiv 2609.07008**（RedKnot-MLA，2026-09-07）：V4-Flash 为 37 个可复用层、56/8 的 Local/Global 头切分；Pro-0813 为 55 层、112/16 头。热工件首 token 延迟加速 **2.02–3.84 倍**，256K 长文下主算子算术量节省 **78.7–79.5%**
- **arXiv 2609.07134**（CCL2026-Eval 任务五）：基于 V4-Flash 的系统总分 0.499 **排名第一**，超过由 **GPT-5.5** 驱动的官方基线 0.448，相对提升 11.4%
- **arXiv 2609.10057**：在 V4 上做 RISC-V 安全断言自动翻译，无人工干预下接受率 78%

### 5. 不可核验：那个「1/4 与 1/8」

我们做了完整检索：DeepSeek 官方文档与官网**无任何 HBM 或显存占用披露**；GitHub 上**不存在 DeepSeek-V4 或 V4.1 的模型仓库**（最新模型仓库仍停在 DeepSeek-V3.2-Exp、Math-V2、OCR-2、Prover-V2）；arXiv 全库以 "V4.1" + DeepSeek 检索**零命中**。

**晟安的态度**：这个数字目前是**无法溯源的市场传闻**，我们不引用它，也建议读者不要拿它去做任何测算。但我们要指出一件事——**价目表比传闻更可信，而且说得更狠**。缓存命中输入价 1/7.5 这个比值，本身就落在传闻所说的「1/8」附近，而它是厂商用真金白银公开承诺的边际成本，不是匿名的硬件指标。**想知道显存省了多少，看价格表和并发上限，比看传闻靠谱。**

## 二、晟安视角

### 1. 真正的新闻不是「省显存」，是「参数规模不再是护城河」

一家头部厂商公开宣布下线自己的旗舰，理由是自家廉价版全面超越——**这在大模型商业史上是罕见的**。它传递的信息比任何 benchmark 都直接。

**晟安的判断**：过去三年，AI 行业的估值逻辑建立在一个隐含假设上——**能力正比于参数规模，参数规模正比于算力投入，因此算力投入是护城河**。V4.1 把这条链子从中间打断了：架构效率的提升，可以让小模型在同一时间点上全面压过大模型。**护城河从"你买了多少卡"变成了"你每张卡上跑出多少智能"**。这不是渐进变化，这是估值锚的更换。我们认为市场对这一点的定价严重不足。

### 2. 对算力硬件：不要做空 HBM，但要重排顺序

市场的第一反应通常是"省显存 = 利空 HBM = 利空存储链"。

**晟安的观点（与市场直觉不同）**：**我们不做空存储链，一分钱都不做空。** 理由是杰文斯悖论——单位智能的显存需求下降，会被需求总量的爆发覆盖掉。2500 的并发上限、1M 的上下文、0.02 元的缓存命中价，会把过去因成本被压抑的场景一次性放出来：全库级检索、长文档 Agent、7×24 小时后台任务、以及最关键的——中小企业第一次能负担得起大模型。**总需求大概率上升。**

**但结构会变，这才是要做的动作。** Engram 那条"把巨型 embedding 表卸载到主机内存"是我们最看重的技术信号：它意味着推理系统的瓶颈正在从 **HBM 容量**向**主机内存带宽、高速互连、存算调度**迁移。晟安在算力硬件方向上的关注权重，从本季度起按这个顺序重排：**互连 > 主机侧内存 / CXL > HBM 容量弹性**。这不是看空谁，是排序问题。

### 3. 对一级市场：我们的尽调问题变了

**晟安的决定（即刻生效）**：过去两年，"我们训练了一个 XX B 参数的模型"是 AI 项目融资 PPT 的第一页。**从今天起，这一页在晟安这里作废。** 我们对 AI 项目只问三个问题：

1. 你单位任务的推理成本是多少？
2. 这个数字过去 6 个月降了多少？
3. 降本来自**你自己的架构**，还是来自**上游厂商降价**？

**第三个问题答不上来的，我们不投。** 因为那不是你的能力，那是 DeepSeek 的能力，而它随时可以通过调价把它收回去。

### 4. 对被投企业：成本假设现在全部过期

这一条我们已经在执行。9 月 14 日之后，同样一个 API 名字，价格降到原来的 1/3 到 1/7.5。这意味着：

- 任何在 2026 年上半年做的 AI 业务模型，**成本侧假设已经全部过时**
- 过去因为"单次调用太贵"而砍掉的产品功能，**现在要重新拿出来算一遍**
- 反过来，如果一家公司的护城河是"我们把推理成本压到了行业一半"，**这条护城河刚刚被上游填平了**

**晟安的提醒**：第三条是真正危险的一条。上游降价对应用层是双刃剑——它降低你的成本，也降低你所有竞争对手的成本，同时抹平你在工程优化上的历史积累。**成本优势不是护城河，只有分发、数据与工作流嵌入才是。** 这句话我们两年前就在说，V4.1 只是把它变成了紧急事项。

## 三、行动线

**晟安已经在做的：**

1. **重算组合内 AI 应用层企业的毛利模型**——用 9 月 14 日后的新价目表压测，重点看那些毛利依赖"低推理成本"的标的
2. **调整算力硬件方向的关注排序**——互连、主机侧内存、存算调度的权重上调，HBM 容量弹性的权重下调（注意：是下调排序，不是看空）
3. **在新项目尽调清单中加入「推理成本下降曲线」**——要求被投方拆出架构自研贡献与上游降价贡献

**晟安选择不做的：**

- **不做空存储链、不做空算力**——杰文斯悖论下总需求上升，做空是拿方向赌结构
- **不参与 9 月 14 日前后的消息面博弈**——这是二级市场短线的事，与我们的持有期无关
- **不投只有参数规模叙事的模型层项目**——这条从今天起是硬性标准，不是倾向性

## 四、关于晟安

晟安投资（惠州）有限公司是一家业务覆盖全国的综合性投资机构，聚焦科技企业，业务涵盖私募股权投资、证券投资、资产管理与投资咨询。本次技术变化对晟安的影响主要落在两条线：

- **已投企业侧**：AI 应用层被投企业的成本结构出现一次性改善窗口，我们正在逐一重算并推动产品侧的功能回补
- **投资决策侧**：AI 方向的估值锚从"参数与算力投入"切换到"单位任务推理成本及其下降来源"，尽调标准同步更新

了解更多：[联系我们](../contact.md) · [核心业务](../business.md) · [返回观点列表](./index.md) · 上一篇：[3600 亿注资的三个口径校准](./2026-09-bank-recap-3600.md)

---

> **风险提示**：市场有风险，投资需谨慎。本网站所载信息仅供参考，不构成任何投资建议或收益承诺。过往业绩不代表未来表现。本文所引 DeepSeek 官方定价与下线公告以 2026-09-11 核查为准，厂商政策可能随时调整；文中明确标注为"市场传闻"的内容未经证实，不应作为决策依据。
