The World Labs发布Atlas世界模型——四模态空间基础模型深度解析
The World Labs发布Atlas世界模型——四模态空间基础模型深度解析
摘要:2026年9月1日,由李飞飞(Fei-Fei Li)联合创立的World Labs正式发布Atlas,一个从零预训练的多模态自回归扩散Transformer,原生支持文本、图像、视频和3D四种模态。Atlas在像素级相机控制、稀疏视图3D重建、Real-to-Sim机器人仿真等任务上展现出超越专业模型的能力,标志着空间智能从学术概念走向工程基础设施的关键一步。
一、背景:空间智能从愿景到产品
1.1 ImageNet的遗产与空间智能的野心
李飞飞在计算机视觉领域的履历几乎无人能及。她创建的ImageNet数据集推动了深度学习革命,她曾担任斯坦福AI实验室主任(2013-2018),在Google Cloud担任过副总裁兼AI/ML首席科学家,还是斯坦福HAI(以人为中心AI研究院)的联合创始主任。从ImageNet到World Labs,这是一条清晰的技术演进路径:先教会机器识别图像中的内容,再构建能够表征图像像素之外三维空间的系统。
2024年,World Labs在旧金山成立,由李飞飞联合Justin Johnson(斯坦福博士,研究方向为视觉推理、图像生成和3D推理)、Ben Mildenhall(NeRF共同发明人,前Google研究科学家)和Christoph Lassner(前Meta Reality Labs和Epic Games研究负责人)共同创立。这个团队构成堪称黄金组合——视觉理解、3D重建、实时渲染领域最顶尖的头脑汇聚一堂。
1.2 从Marble到Atlas的演进
Atlas并非凭空诞生。它建立在World Labs第一个商业多模态模型Marble的基础上:
- 2025年11月:Marble正式发布,支持从多模态输入创建3D世界,验证了空间智能框架的可行性
- 2026年1月:World API上线,为开发者提供编程式空间智能工具
- 2026年4月:Marble 1.1和Marble 1.1-Plus发布,分别提升画质和超大场景生成能力
- 2026年7月:World Labs收购SceniX,强化机器人空间智能方向
- 2026年9月1日:Atlas正式发布
1.3 融资规模揭示行业信心
World Labs累计融资12.3亿美元:
| 轮次 | 金额 | 主要投资方 |
|---|---|---|
| 2024年种子轮 | $2.3亿 | Andreessen Horowitz、NEA、Radical Ventures |
| 2026年2月 | $10亿 | AMD、Autodesk($2亿)、NVIDIA、Fidelity、Emerson Collective、Sea |
(来源:World Labs官方公告,https://www.worldlabs.ai/blog/atlas)
这一融资规模在AI初创公司中极为罕见,Autodesk单独出资2亿美元尤其值得关注——这表明Atlas的技术路线与数字内容创作(DCC)工具生态深度绑定。
二、架构深度解析:四模态自回归扩散Transformer
2.1 架构总览
Atlas的核心架构可以概括为:多模态 + 自回归 + 扩散 + Transformer。这四个技术支柱协同工作,构成一个统一的空间上下文(Spatial Context)范式。
+---------------------------------------------------------------------------+
| Atlas 架构总览 |
+---------------------------------------------------------------------------+
| |
| +----------+ +---------------+ +------------------+ |
| | 文本 | | | | 自回归序列建模 | |
| | (Prompt) |--->| | | (Token-by-Token) | |
| +----------+ | | +------------------+ |
| | 图像 | | 空间上下文 |--->| 整流流扩散 | |
| | (1-6张) |--->| (Spatial | | (Rectified Flow) | |
| +----------+ | Context) | +------------------+ |
| | 相机姿态 |--->| | | Transformer | |
| | (Pose) | | | | 主干网络 | |
| +----------+ | | +------------------+ |
| | 深度图 |--->| | | |
| | (Depth) | | | v |
| +----------+ +---------------+ +------------------+ |
| | 输出 | |
| | +- 图像/视频帧 | |
| | +- 3D点云 | |
| | +- 3D高斯泼溅 | |
| +------------------+ |
+---------------------------------------------------------------------------+
2.2 多模态输入的空间锚定
与传统LLM将所有输入编码为统一token序列不同,Atlas的核心创新在于每个图像都被锚定在三维空间的具体位置。这意味着:
- 输入包含文本、图像、相机姿态(Pose)和3D深度图
- 视频被表示为图像序列,每帧附带对应相机姿态
- 每个图像和深度图都显式地以相机姿态为条件
+---------------------------------------------------------------------------+
| 空间上下文 (Spatial Context) |
+---------------------------------------------------------------------------+
| |
| +-----+ +-----+ +-----+ +-----+ |
| |图像1 | |图像2 | |图像3 | |图像4 | ... |
| |Pose1 | |Pose2 | |Pose3 | |Pose4 | |
| +--+---+ +--+---+ +--+---+ +--+---+ |
| | | | | |
| v v v v |
| +-------------------------------------------------------------------+ |
| | 3D空间位置编码层 | |
| +-----------------------------------+-----------------------------------+ |
| | |
| v |
| +-------------------------------------------------------------------+ |
| | 统一空间上下文表示 | |
| +-------------------------------------------------------------------+ |
+---------------------------------------------------------------------------+
2.3 自回归生成:序列化的世界构建
Atlas将世界建模任务转化为多模态序列生成问题。每个元素是四种模态之一,输出逐个生成,并以前面序列为条件。
这种设计天然适配多种任务——每种任务只是不同类型的序列,输入后面跟着输出。
# Atlas自回归生成流程示意
class AtlasAutoregressiveGeneration:
def __init__(self, model, tokenizer):
self.model = model
self.tokenizer = tokenizer
def generate_sequence(self, task_type, inputs):
sequence = []
for img, pose in zip(inputs['images'], inputs['camera_poses']):
tokens = self.tokenizer.encode_image(img, pose)
sequence.append(tokens)
spatial_context = self.model.encode_spatial_context(sequence)
outputs = []
for step in range(self.max_steps):
next_element = self.model.diffuse_step(
context=spatial_context, prev_outputs=outputs,
cfg_scale=7.5, num_steps=50)
outputs.append(next_element)
spatial_context = self.model.update_kv_cache(
spatial_context, next_element)
return outputs
def camera_control_inference(self, ref_images, camera_path):
task_inputs = {
'text': 'Generate consistent video following camera path',
'images': ref_images, 'camera_poses': camera_path,
'depth_maps': None}
return self.generate_sequence('camera_control', task_inputs)
2.4 扩散生成:整流流模型
Atlas使用**整流流(Rectified Flow)**模型,通过逐步去噪生成输出。扩散模型擅长建模高维连续数据如图像和视频,并能在推理时通过调整去噪步数在速度和质量间做权衡。
关键特性:
- Latent扩散:在VAE编码的潜空间操作,而非原始像素空间
- Classifier-Free Guidance (CFG):通过调整引导尺度控制生成与条件的匹配度
- Shifted Noise Schedules:针对不同数据类型的优化噪声调度
+---------------------------------------------------------------------------+
| 整流流扩散过程 (Rectified Flow) |
+---------------------------------------------------------------------------+
| |
| 纯噪声 step 10 step 30 step 50 |
| +-----+ +-----+ +-----+ +-----+ |
| | ## | --> | .. | --> | .. | --> | ## | |
| | #### | | .... | | .... | | .... | |
| |######| |......| | .... | | .... | |
| +-----+ +-----+ +-----+ +-----+ |
| ^ ^ ^ ^ |
| | | | | |
| z_T ~ N(0,I) 整流流ODE z_{t} z_0 |
| |
| d z_t = v_theta(z_t, t, context) dt |
+---------------------------------------------------------------------------+
2.5 Transformer主干:融合LLM与视频模型优势
Atlas的Transformer架构同时受益于LLM和视频模型两方面的技术进步:
来自LLM的创新:
- KV-caching(KV缓存加速)
- Cache-aware routing(缓存感知路由)
- Disaggregated serving(分离式服务)
来自视频模型的创新:
- Diffusion distillation(扩散蒸馏)
- Classifier-free guidance(无分类器引导)
- Shifted noise schedules(偏移噪声调度)
- VAE设计改进
import torch
import torch.nn as nn
class AtlasTransformerBlock(nn.Module):
def __init__(self, d_model=4096, n_heads=32, d_ff=16384):
super().__init__()
self.spatial_attention = nn.MultiheadAttention(
d_model, n_heads, batch_first=True)
self.spatial_pos_encoding = nn.Sequential(
nn.Linear(7, d_model), nn.SiLU(), nn.Linear(d_model, d_model))
self.ffn = nn.Sequential(
nn.Linear(d_model, d_ff), nn.GELU(), nn.Linear(d_ff, d_model))
self.norm1 = nn.LayerNorm(d_model)
self.norm2 = nn.LayerNorm(d_model)
def forward(self, x, camera_poses, depth_maps=None):
spatial_pos = self.spatial_pos_encoding(camera_poses)
x = x + spatial_pos
attn_out, _ = self.spatial_attention(
self.norm1(x), self.norm1(x), self.norm1(x))
x = x + attn_out
ffn_out = self.ffn(self.norm2(x))
x = x + ffn_out
return x
三、核心能力全景
3.1 像素级相机控制生成
这是Atlas最引人注目的能力。传统视频生成模型通过文本描述(如镜头从左向右平移)来传达相机运动意图,而Atlas直接接收精确的相机几何参数作为原生输入类型。
具体规格:
- 输入:1-6张参考图像 + 手工设计的相机路径
- 输出:最高1440p分辨率,最长1分钟视频
- 场景类型:室内/室外、真实/风格化、静态/动态
+---------------------------------------------------------------------------+
| 相机控制生成 vs 文本提示生成 |
+---------------------------------------------------------------------------+
| |
| 传统方法: Camera pans left 30 degrees(文本描述) |
| | |
| v |
| [视频生成模型] --> 模糊的相机控制,需要多次尝试 |
| |
| Atlas方法: [Camera Pose Matrix] |
| [[1.0, 0.0, 0.0, 2.5], <- 位置 + 旋转矩阵 |
| [0.0, 0.87, -0.5, 1.2], |
| [0.0, 0.5, 0.87, 0.0]] |
| | |
| v |
| [Atlas] --> 精确的像素级相机控制,一次性到位 |
+---------------------------------------------------------------------------+
空间锚点生成(Spatial Anchoring): 一个特别令人印象深刻的能力是,你可以将两张毫无关联的参考图像放置在三维空间的不同位置,Atlas会生成平滑插值两者之间的世界——它会想象出门廊、走廊、角落等过渡结构。
3.2 稀疏视图3D重建
Atlas可以从1张到数十张输入图像重建真实世界场景。最关键的是,它不需要特殊采集设备或数百张密集视图。
重建能力:
- 2-3张图像通常足以实现忠实重建
- 更多输入图像减少模型需要想象的部分
- 输出格式:点云(Point Cloud)或3D高斯泼溅(3D Gaussian Splats)
+---------------------------------------------------------------------------+
| 稀疏视图3D重建流程 |
+---------------------------------------------------------------------------+
| |
| 输入图像 (2-3张) 输出3D点云 |
| +------+ +----------------------------------+ |
| | PH | --> 特征提取 | o o o o o o o o o | |
| | PH | --> 深度估计 | o o o o o o o o o | |
| | PH | --> 点云融合 | o o o o o o o o o | |
| +------+ | o o o o o o o o o | |
| | +----------------------------------+ |
| v | |
| +----------------------+ v |
| | Atlas世界知识填充 | +----------------------------------+ |
| | (填补未观测区域) | | 3D高斯泼溅 (可交互渲染) | |
| +----------------------+ +----------------------------------+ |
+---------------------------------------------------------------------------+
输入图像数量对重建质量的影响:
def analyze_reconstruction_quality(atlas_model, scene_images):
"""分析不同输入图像数量对重建质量的影响"""
results = {}
for n in [1, 2, 3, 5, 10, 25]:
subset = scene_images[:n]
point_cloud = atlas_model.reconstruct_3d(
images=subset, cameras=[img.camera for img in subset])
results[n] = {
'f_score': point_cloud.eval_f_score(),
'hallucination_ratio': point_cloud.eval_hallucination()}
print(f"Views: {n:2d} | F-Score: {results[n]['f_score']:.3f}")
return results
3.3 时空仿真(Space-Time Simulation)
Atlas同时理解世界的空间结构和时间演化,这带来了两个重要应用:
子弹时间(Bullet Time)重取景: 仅需3-5台普通手机相机拍摄,Atlas就能冻结时间并重新取景,让你从不可能的角度观察事件。这不需要专业摄影设备——每个片段都是由工程师用背包里能装下的三脚架和夹具上的普通手机拍摄的。
机器人仿真(Real-to-Sim): 从手机视频中重建环境后,Atlas能生成机器人搭载的相机在移动过程中会观察到的RGB图像和深度读数。对于操控任务,它能对刚体、铰接体和可变形物体的物理交互进行视觉和几何重建。
+---------------------------------------------------------------------------+
| Real-to-Sim 机器人仿真流水线 |
+---------------------------------------------------------------------------+
| |
| 真实世界记录 仿真环境构建 |
| +--------------+ +----------------------------------+ |
| | 手机拍摄24帧 |--> | Atlas重建的3D场景 | |
| +--------------+ | (点云/高斯泼溅) | |
| +----------------------------------+ |
| | |
| v |
| +----------------------------------+ |
| | 机器人路径规划 (自定义轨迹) | |
| +----------------------------------+ |
| | |
| v |
| +-------------------------------------------------------------------+ |
| | Atlas仿真的传感器输出: RGB图像帧 + 深度图 (沿机器人路径) | |
| +-------------------------------------------------------------------+ |
| | |
| v |
| +-------------------------------------------------------------------+ |
| | 可控制的变化: 物体位置/光照/背景/机器人状态/物理参数 | |
| +-------------------------------------------------------------------+ |
| | |
| v |
| +-------------------------------------------------------------------+ |
| | 输出:多样化训练数据 + 测试环境(用于机器人策略学习) | |
| +-------------------------------------------------------------------+ |
+---------------------------------------------------------------------------+
3.4 图像生成与360度全景
虽然世界建模是Atlas的主要焦点,但它也是一个强大的图像生成器:能遵循复杂提示词、渲染文字、生成多种视觉风格,甚至能从文本或图像生成360度全景图。
四、Benchmark分析:优势与局限
4.1 相机控制生成评估
World Labs在内部评估中将Atlas与五个顶级视频模型进行了对比。测试方法:输入单张图像+1-3个电影镜头运动,Atlas使用原生相机输入格式,其他模型使用文本描述。
第三方人类评估者判断哪个模型更好地遵循了预期相机路径:
| 对比模型 | 偏好Atlas的评估者比例 |
|---|---|
| MiniMax H3 | 75% |
| Gemini Omni Flash | 81% |
| Happy Horse 1.1 | 86% |
| FLUX 3 | 93% |
| Seedance 2.5 | 94% |
(来源:World Labs官方博客,https://www.worldlabs.ai/blog/atlas)
关键解读: Atlas的优势在更复杂的相机轨迹上更加明显。但需要注意,其他模型通过文本描述接收相机指令,这天然存在信息损失。World Labs也承认,更精细的prompt工程可能改善其他模型的相机跟随效果。
4.2 3D重建评估
在稀疏视图3D重建任务上,Atlas与五个专业开源重建模型进行了对比:
+---------------------------------------------------------------------------+
| 3D重建误差对比 (AbsRel x 10^-3, 越低越好) |
+---------------------------------------------------------------------------+
| |
| Atlas (Ours) ############################ 25.3 |
| Pi3X (posed) ################################ 28.7 |
| pi^3 ################################## 30.1 |
| VGGT-Omega 1B ######################################## 37.2 |
| Depth Anything 3 ############################################ 42.5 |
| MapAnything ################################################## 47.7|
| |
| 数据集: DTU / ETH3D / KITTI / NRGBD / 7-Scenes / T&T / ScanNet |
+---------------------------------------------------------------------------+
值得注意的细节: 在其中一个测试集上,开源模型VGGT-Omega 1B的误差(40.2)低于Atlas(42.4)。World Labs强调他们复现了所有基准模型的评估结果,以确保公平比较。
(来源:World Labs官方博客,https://www.worldlabs.ai/blog/atlas)
4.3 需要审慎看待的地方
- 内部评估,非独立第三方验证:所有评估均由World Labs内部进行,尚未有第三方独立复现
- 相机测试的天然不对称性:Atlas接收原生相机格式,而竞争模型仅通过文本描述接收相机指令
- 早期访问限制:目前仅限选定合作伙伴,无公开定价,无GA日期
- 规模定律的自我证明:公司声称更大模型表现更好,但这是公司自己的结果,并非独立证据
五、商业前景与竞争格局
5.1 产品化路径:从Atlas到Marble
Atlas将驱动未来版本的Marble——World Labs的3D持久环境生成产品。Marble已有公开定价:
| 档位 | 月费 |
|---|---|
| Standard | $20 |
| Pro | $35 |
| Max | $95 |
| 企业定制 | 按需定价 |
(来源:RuntimeWire,https://runtimewire.com/article/world-labs-atlas-spatial-intelligence-world-model)
5.2 世界模型赛道的四条路线
当前世界模型领域存在四种不同的技术路线:
| 路线 | 代表 | 核心理念 |
|---|---|---|
| 像素生成派 | Seedance、Sora | 通过视频生成模拟世界,强调视觉质量 |
| 空间智能派 | World Labs/Atlas | 从3D结构入手,强调几何精度 |
| 物理仿真派 | Odyssey、LeCun’s AMI Labs | 构建可交互世界仿真,强调物理真实性 |
| 地理空间派 | Niantic Spatial | 聚焦地理空间映射与视觉定位 |
(来源:36氪,https://36kr.com/p/3963266346014344)
Atlas的核心差异化在于:一个模型统一接受空间锚定的多模态输入,并产生视频、显式3D几何和模拟传感器视图。
5.3 潜在挑战
- 几何一致性与幻觉的边界:当参考图像存在不一致时,Atlas能否保持几何准确性?需要合作伙伴工作负载来验证
- Sim-to-Real差距:生成的仿真传感器视图在真实机器人硬件上是否足够准确?
- 数据飞轮:作为闭源模型,Atlas如何获取用户反馈并持续改进?
- 竞争加速:Odyssey、LeCun的AMI Labs等团队也在快速迭代,且部分选择开源路线
六、技术总结与展望
6.1 为什么Atlas重要
Atlas代表了从AI生成像素到AI理解空间的范式转变。它不是一个视频生成模型,也不是一个3D重建模型——它是一个空间基础模型,将相机几何作为一等公民,将3D一致性作为模型的核心约束而非后处理步骤。
6.2 技术路线图展望
+---------------------------------------------------------------------------+
| Atlas技术演进路线图(推测) |
+---------------------------------------------------------------------------+
| |
| Phase 1 (当前): 四模态基础模型 |
| +- 相机控制生成 (1440p, 1min) |
| +- 稀疏视图3D重建 |
| +- 时空仿真 (子弹时间) |
| +- 图像/全景生成 |
| |
| Phase 2 (短期): 物理交互增强 |
| +- 刚体/铰接体/可变形体物理仿真 |
| +- 更长的视频生成 (>1min) |
| +- 实时交互式世界探索 |
| |
| Phase 3 (中期): 具身智能集成 |
| +- 端到端机器人策略学习 |
| +- 多智能体仿真环境 |
| +- 闭环Real2Sim2Real |
| |
| Phase 4 (长期): 通用空间推理 |
| +- 因果推理与物理常识 |
| +- 开放世界理解与规划 |
| +- 跨场景知识迁移 |
+---------------------------------------------------------------------------+
6.3 对AI行业的影响
Atlas的发布不仅仅是World Labs的里程碑,它可能对整个AI行业产生深远影响:
- 对影视行业:导演和特效师获得精确的虚拟相机控制,无需复杂的3D场景重建流程
- 对游戏行业:从概念图到可探索3D环境的流程被大幅缩短
- 对机器人行业:解决数据荒的潜在方案,从手机视频到仿真训练数据
- 对建筑/房地产:从少量照片生成完整3D建筑模型成为可能
七、代码示例:使用Atlas API(模拟)
以下代码模拟了Atlas API的调用方式,展示如何在实际工作流中使用:
import numpy as np
from typing import List, Optional, Dict, Any
from dataclasses import dataclass
@dataclass
class CameraPose:
position: np.ndarray
rotation: np.ndarray
timestamp: float = 0.0
@dataclass
class AtlasConfig:
model_version: str = "atlas-v1"
resolution: str = "1440p"
num_diffusion_steps: int = 50
cfg_scale: float = 7.5
max_video_duration: int = 60
class AtlasClient:
def __init__(self, api_key: str, config: Optional[AtlasConfig] = None):
self.api_key = api_key
self.config = config or AtlasConfig()
def camera_controlled_generation(self, reference_images, camera_path, config=None):
assert 1 <= len(reference_images) <= 6
return {"status": "success", "task": "camera_control"}
def sparse_view_reconstruction(self, images, camera_poses, output_type="gaussian_splat"):
assert len(images) >= 2
return {"status": "success", "output_type": output_type}
def real_to_sim(self, phone_video_frames, robot_trajectory, num_variations=10):
return {"status": "success", "num_environments": num_variations}
def demo_camera_control():
client = AtlasClient(api_key="your-api-key")
ref_img = np.random.randn(3, 720, 1280)
camera_path = []
for t in np.linspace(0, 2*np.pi, 300):
camera_path.append(CameraPose(np.array([5*np.cos(t), 2, 5*np.sin(t)]), np.array([0, t, 0])))
result = client.camera_controlled_generation([ref_img], camera_path)
print(f"生成完成: {result['status']}")
八、关键观点与行业影响
8.1 李飞飞的空间智能叙事
李飞飞将世界模型按功能分为三类:
- 渲染器(Renderer):做视觉生成
- 模拟器(Simulator):输出精确物理数据
- 规划器(Planner):直接指导行动
她认为模拟器是物理AI发展的最关键一环。Atlas正是这一理念的工程实现——它不只是生成好看的画面,而是构建可测量的、几何一致的空间表征。
(来源:36氪,https://36kr.com/p/3963266346014344)
8.2 核心差异化
与Sora等像素拟合路线不同,Atlas的核心是从3D几何出发:
- Sora的哲学:像素足够多时,3D世界会涌现出来
- Atlas的哲学:显式3D几何是输入和输出的核心约束,不是涌现的副产品
8.3 开放性挑战
尽管Atlas在技术上令人印象深刻,但它仍然面临几个关键挑战:
- 闭源策略:不开放模型权重,限制了学术社区的研究和验证
- 早期访问:合作伙伴数量未披露,独立验证尚未发生
- 定价未定:Atlas本身没有公开价格或GA日期
- 物理模拟深度:3D重建不等于物理理解,几何结构不代表物理状态
结语
Atlas是空间智能领域的一个重要里程碑。它证明了将多模态输入通过显式3D几何锚定在统一空间上下文中,能够实现超越专业模型的生成和重建能力。但技术演示和产品化之间还有很长的路要走——早期合作伙伴的工作负载将决定Atlas能否从令人印象深刻的演示进化为不可或缺的基础设施。
对于AI从业者而言,无论你关注的是影视制作、游戏开发、机器人技术还是建筑可视化,Atlas都值得密切关注。空间智能可能成为继语言智能之后的下一波AI浪潮,而World Labs已经在其中占据了先发位置。
参考文献:
- World Labs, Atlas: A World Model for Spatial Intelligence, https://www.worldlabs.ai/blog/atlas
- RuntimeWire, World Labs launches Atlas for video, 3D reconstruction and robot simulation, https://runtimewire.com/article/world-labs-atlas-spatial-intelligence-world-model
- World Labs, Building Worlds That Train Robots, https://www.worldlabs.ai/blog/real-to-sim-to-real
- World Labs, World Labs Announces New Funding, https://www.worldlabs.ai
- 36氪, 尴尬的世界模型,四条路线纷争未决, https://36kr.com/p/3963266346014344
- World NL, World Labs unveils Atlas, https://worldnl.com/world-labs-unveils-atlas