晟安观点 · AI 算力
World Labs 发布新一代世界模型 Atlas:从"读懂语言"到"理解世界"的转折点
2026 年 9 月 2 日,李飞飞联合创立的 World Labs 发布新一代多模态世界模型 Atlas——官方 X 原文称其为"世界上第一个能以像素级相机控制生成图像与视频帧、并将其重建为 3D 的多模态世界模型"。Atlas 把"视频生成 + 3D 重建 + 时空模拟"统一到以 3D 空间为核心的基础模型中,标志 AI 从"语言智能"向"空间物理智能"跃迁的关键一步。对晟安而言,它再次印证了"算力底座 > 模型层"的投资判断——世界模型对算力的需求是当前主流大语言模型的 5-50 倍。
一、事实
- 发布方:World Labs——李飞飞 2024 年与 Justin Johnson(计算机视觉)、Christoph Lassner(生成式 AI)、Ben Mildenhall(计算机图形学,NeRF 作者之一)共同创立的空间智能公司
- 模型名称:Atlas(2026-09-02 发布)
- 官方定位:World Labs X 原文:"世界上第一个能以像素级相机控制生成图像与视频帧、并将其重建为 3D 的多模态世界模型";World Labs 称之为"omni model (全模态模型)",从零开始预训练(注意:DeepMind Genie 3、英伟达 Cosmos 3 也被自身定位为"世界模型"或"全模态世界模型"——"首个"是 World Labs 的自述,行业内仍有讨论)
- 模态:原生处理文本、图像、视频、3D 四种数据
- 参数 / 训练数据 / 推理成本:未公开——World Labs 截至公告日未公布参数量、训练数据规模、scaling 曲线、推理成本、延迟数据;仅定性表述"提升一档算力解锁新能力"
- 核心架构:多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer);关键设计是 Spatial Context(空间上下文)——每一张输入图像与对应相机位姿绑定,构成共享的 3D 锚定空间
- 关键能力(四大):
- 相机可控生成:1-6 张参考图 + 用户指定机位角度 → 最高 1440p、最长 1 分钟视频
- 空间重建:1 张到几十张输入图 → 新视角图像 + 点云 + 3D 高斯泼溅(Gaussian Splatting)
- 时空模拟:子弹时间(3-5 台普通手机即可)、机器人 Real-to-Sim
- 图像生成:文生图 + 360 度全景图
- Benchmark 表现:
- 相机可控生成(World Labs 自评,第三方人类盲评胜率):vs MiniMax H3 75% / vs Gemini Omni Flash 81% / vs 阿里 HappyHorse 1.1 86% / vs FLUX 3 93% / vs 字节 Seedance 2.5 94%(运镜越复杂优势越大;注意:其他模型不接受相机位姿作为原生输入,运镜只能通过文本提示描述——胜率衡量的是"原生相机接口 vs 文本描述运镜"的差距)
- 3D 重建(稀疏视角 AbsRel×10⁻³,越低越好):Atlas 25.3 / Pi3X(posed) 28.7 / π³ 34.7 / VGGT-Ω 1B 36.4 / Depth Anything 3 39.3 / MapAnything 47.7
- 与同期世界模型对比:
- Google DeepMind Genie 3(2025-08):文本实时生成 720p、20-24fps 交互式环境
- 英伟达 Cosmos 3(2026-06):统一架构处理语言 / 图像 / 视频 / 声音 / 机器人动作
- World Labs 自家 Marble(2025-11):文本 / 图片 / 视频 / 粗略 3D 布局 → 可探索 3D 世界
- Atlas 的核心差异:首个把"生成 + 重建 + 仿真"统一到 3D 空间核心的模型;李飞飞 2026 年 6 月曾把世界模型分为 Renderer(渲染器)/ Simulator(模拟器)/ Planner(规划器) 三类,Atlas 已在同一基础模型中承担前两者
- 商业化路径:不开源;当前仅向少数合作伙伴开放早期访问;后续将驱动 Marble 及 World Labs 其他产品
- World Labs 时间线(理解 Atlas 的背景):2024-09 隐身模式 + 2.3 亿美元融资 / 2025-11 Marble / 2026-01 World API / 2026-02 10 亿美元新融资(Autodesk 投 2 亿美元、AMD、英伟达、Fidelity 跟投,估值约 50 亿美元)/ 2026-07 收购仿真公司 SceniX / 2026-09-02 Atlas
- 信息来源:World Labs 官方博客 worldlabs.ai/blog/atlas · 机器之心 2026-09-02 转载 · DeepTech 深科技 2026-09-02 报道
二、晟安视角
1. 为什么我们关注这件事
在晟安的 AI 投资框架里,我们把"AI 算力"列为第二条主线,与"国产替代""未来能源"并列。这条主线下,我们不押注"哪家模型公司会赢"——那是 100 选 1 的赌博。我们押注的是"无论谁赢,都需要这些底座":
- 算力芯片:GPU、NPU、TPU
- 互连与加速:DPU、网卡、PCIe Switch
- 存储:HBM、SSD 主控、分布式存储
- 光通信:800G/1.6T 光模块
Atlas 这类"多模态世界模型"对算力的需求,是当前主流大语言模型的 5-50 倍。原因很简单:
- 数据维度爆炸:视频是文本 token 的 ~1000 倍(按帧算)
- 3D 几何计算:每帧要处理点云、网格、辐射场
- 物理仿真:刚体、软体、流体的微分方程求解
- 长上下文:视频秒级 → 分钟级 → 小时级
当一家头部实验室发布"首个多模态世界模型"时,真正的赢家不是模型本身,而是为它提供算力、存储、网络的全部底座供应商。
2. 与晟安已投企业的关联
| 晟安已投 | 赛道 | 在世界模型时代的位置 |
|---|---|---|
| 摩尔线程 | GPU 与人工智能算力 | 训练侧主算力,国产替代首选 |
| 云豹智能 | DPU 与数据中心芯片 | 推理侧卸载,存算分离枢纽 |
| 思朗科技 | 高性能处理器芯片 | 视频/3D 专用加速器 |
| 康芯威 | 存储主控芯片 | 视频数据湖、3D 资产库存储底座 |
| 祥益鼎盛 | 实业投资与产业运营 | 算力中心的物理基础设施 |
Atlas 不是晟安已投企业的客户——但它是晟安"算力底座"叙事的强力旁证。每一家头部实验室发布新一代模型,都在为这条产业链集体背书。
3. 世界模型为什么是"下一个十年的入场券"
从 2020 年 GPT-3 到 2026 年的多模态世界模型,我们看到的演进路径是:
语言模型(理解符号)→ 多模态模型(理解图文)→ 具身智能(理解动作)→ 世界模型(理解物理)
"世界模型"这个词的真正含义,是机器第一次具备了对"如果……会怎样"的因果推理能力——这与单纯的"下一个 token 是什么"是本质不同的范式跃迁。
Yann LeCun 在 2022 年公开说过:"下一代 AI 不是更大的 LLM,而是能理解世界运转方式的世界模型。"Atlas 是这条路上的第一个公开可验证的里程碑。
它的影响将沿着三个方向扩散:
- 具身智能(Embodied AI):机器人、自动驾驶、AR/VR 不再需要"硬编码规则"
- 内容生产:影视、游戏、3D 设计从"工具辅助"走向"AI 主导"
- 科学研究:流体、材料、气象、生命的模拟从"专用求解器"走向"通用世界模型"
三、启示
- 对算力产业链:每一次范式跃迁(CNN → Transformer → LLM → 世界模型)都伴随算力需求 10-100 倍的跃迁。布局算力底座的窗口期,比布局模型层更长、确定性更高。
- 对内容/影视/游戏行业:3 年内"AI 主导的内容生产流水线"会成为标配;现在还在用 SD/Midjourney 做素材的团队,2 年内会被甩开。
- 对中国硬科技投资:当美国头部实验室在大模型与世界模型上持续突破,"国产替代"不再只是政策驱动,而是被市场刚需倒逼。摩尔线程们的时间窗口,比想象中更紧。
- 对晟安:继续加注"算力底座"主线,特别是在 DPU、HBM 国产化、3D 专用加速器这些模型层下面 1-2 层的赛道。
四、关于晟安
晟安投资(惠州)有限公司是一家业务覆盖全国的综合性投资机构,聚焦科技企业,业务涵盖私募股权投资、证券投资、资产管理与投资咨询。"AI 算力"是晟安在硬科技赛道的三大投资主线之一。