跳到主要内容

李飞飞多模态世界模型发布:一张图补全 3D 世界

2026 年 9 月 2 日,「AI 教母」李飞飞旗下的 World Labs 发布了被其称为「全球首个多模态世界模型」的 Atlas。这个新一代世界模型不再只是生成一段可互动的视频,而是能够以像素级的相机控制生成图像和视频帧,并完成 3D 重建——用李飞飞团队自己的 slogan 来说,就是「建模世界,移动相机,模拟空间和时间」。

一张图补全 3D 世界,还能给机器人造训练场。Atlas 的发布,被业界视为世界模型从「生成内容」走向「理解与模拟真实世界」的关键一步,也把空间智能(Spatial Intelligence)的想象,进一步推向了可落地的产品形态。

Atlas 能做什么:四大能力

Atlas 是一个多模态自回归扩散 Transformer,官方展示了四类核心能力:

第一,相机控制生成。仅需一张图片,Atlas 即可生成具有像素级相机控制的图片和视频,最高可输出 1 分钟、1440p 的视频。用户指定任意相机位置和角度,模型就能生成对应的参考视图,实现类似「子弹时间」的拍摄效果。

第二,空间重建。Atlas 可以基于一张到数十张输入图像,重建真实世界场景。它既能生成新视角下的图像帧,也能输出显式 3D 表示,效果据称超过当前专门针对 3D 重建训练的最先进模型。

第三,时空模拟。Atlas 可以根据输入视频同时建模空间和时间,转换已有视频中的观察视角,制作具有戏剧性的视觉效果,同时支持机器人的 Real-to-Sim 工作流。

第四,图像生成。Atlas 可以根据文本生成图片和 360° 全景图,能够遵循复杂 Prompt、准确渲染文字,并生成大量不同的视觉风格。

技术内核:多模态自回归扩散 Transformer

从技术细节上看,Atlas 是一个「全能模型」(omni model),目标是在一个统一的模型架构中,同时处理多任务、多种输入和输出数据,而空间控制是整个模型的核心。

为了实现这些目标,李飞飞团队设计了一种全新的基础架构——多模态自回归扩散 Transformer。文本、图像、视频、3D 数据等各种输入都会被锚定在三维空间中,形成一个空间上下文,Atlas 再根据这个上下文生成多模态输出。比如,把两张毫无关系的参考图片放进同一个上下文中,再分别指定它们在 3D 空间中的位置,Atlas 就能把它们缝合成一个空间自然、连续的世界。

具体拆解来看,「多模态」指 Atlas 可以原生处理文本、图像、相机位姿、3D 深度图等多种数据类型,视频被表示为图像序列,每一张图像和深度图都对应一个明确的相机位姿;「自回归」指 Atlas 操作的是一系列元素组成的序列,每次生成新输出都以已有的序列内容为条件;「扩散」指 Atlas 是一个 Rectified Flow(校正流)模型,通过逐步去噪来生成输出,推理时只需改变去噪步骤数量,即可在速度与质量之间取得平衡。

换句话说,Atlas 融合了大语言模型和视频模型中的大量思想——它既可以利用 KV Cache、缓存感知路由、解耦式服务等原本服务于 LLM 推理和加速的技术,又与现代图像、视频生成模型一样,是潜空间扩散模型,可以利用扩散蒸馏、无分类器引导、移位噪声调度等算法。

研究团队在相机控制生成和 3D 重建两个关键任务上进行了定量评估:在相机控制生成上,Atlas 优于 SOTA 视频模型,且相机轨迹越复杂优势越大;在根据稀疏输入视角进行 3D 重建的任务中,Atlas 同样超过了表现最好的专业开源 3D 重建模型。

具身智能 Real-to-Sim 的关键一步

Atlas 发布后,业界关注的焦点汇聚在具身智能上。英伟达机器人主管 Jim Fan 直接指出,这是机器人领域 Real-to-Sim 的一大步。

把 World Labs 今年的动作联系起来,Atlas 的意义会更加清晰。今年 6 月,李飞飞亲自下场定义世界模型,将其分类为渲染器、模拟器、规划器,并明确指出「最关键的是模拟器」——因为模拟器承担的是世界本身的几何、物理和动力学,是渲染和行动共同依赖的基础。紧接着,7 月 21 日,World Labs 收购了机器人仿真公司 SceniX;7 月 28 日,公开了 Real-to-Sim-to-Real 系统,强调机器人最大的瓶颈是缺乏廉价、可控、可规模化的训练经验。

现在,Atlas 打通了这条路径:从真实照片/视频,到 3D 空间,再到机器人传感器视图和可变化的模拟环境。对于机器人模拟,仅需喂给 Atlas 几张照片,它就能生成逼真的 RGB 和深度数据,让机器人能在更多不同的模拟空间中训练和测试。这正是具身智能行业最稀缺的能力——廉价、可控、可规模化的训练数据。

对行业意味着什么

Atlas 的发布,对多个领域都有实质影响。

对视觉特效行业而言,像素级相机控制和「子弹时间」效果,意味着电影、广告等内容的制作门槛大幅降低,创作者可以用一张图或一段视频,生成原本需要昂贵实拍或复杂后期才能实现的镜头。

对具身智能行业而言,Real-to-Sim 的能力直击机器人训练数据稀缺的痛点。当机器人可以在 Atlas 生成的多样化模拟环境中训练,再迁移到真实世界,训练成本和时间都可能显著下降,这有望加速机器人从实验室走向真实场景。

对世界模型赛道而言,Atlas 从设计之初就为 Scaling 做好了准备。李飞飞团队表示,已经看到非常有利的证据,证明 Atlas 的能力会随着规模扩大而继续提高。这为「世界模型是否遵循 Scaling Law」提供了新的注脚,也让空间智能的路线之争——渲染器、模拟器、规划器哪个更重要——有了更明确的答案倾向。

目前,Atlas 正在向部分合作伙伴开放早期访问,也可以在官网申请访问权限。World Labs 官方表示,接下来 Atlas 会成为未来版 Marble 以及 World Labs 其他产品的底层模型。这意味着,Atlas 不只是单个产品,而是 World Labs 整个空间智能产品线的地基。

当然,Atlas 目前仍处于早期访问阶段,其能力边界、商业化路径都还需要时间验证。但无论如何,一张图补全 3D 世界、为机器人造训练场的 World Labs Atlas,已经把世界模型从概念推向产品,也为 AI 从「生成内容」走向「理解世界」打开了新的大门。


参考来源:量子位《李飞飞发布:全球首个多模态世界模型》、IT 之家《全球首个多模态世界模型:李飞飞 World Labs 发布 Atlas》、新浪财经、DeepTech 深科技、World Labs 官方博客。