空间锚定:从意图描述到几何约束的相机控制生成
在人工智能从语言智能迈向物理世界认知的关键转折点上,李飞飞联合创立的 World Labs 于九月一日正式发布了新一代世界模型(World Model: 能够理解、模拟并预测三维物理世界状态与动态演变的 AI 系统)——Atlas。与以往仅在二维像素空间进行概率猜测的模型不同,Atlas 从底层设计上就确立了多模态时空统一表征的能力,能够同时接收并深度处理文本、图像、视频以及三维空间数据。这一突破性底座的建立,首先直观地体现在对相机控制生成(Camera-Controlled Generation: 基于三维空间精确坐标与位姿约束驱动视觉画面的生成技术)的范式重塑上。
回顾传统的视频生成模型,其交互逻辑本质上依然停留在提示词文本与二维像素之间的概率联想。当创作者在提示词中输入“镜头向左移动”时,传统生成模型只能在抽象的语义空间中进行发散式猜测,并在二维像素网格内强行推断下一帧画面的像素分布。这种方式存在一个致命缺陷:让镜头向左移动仅仅是一句模糊的意图描述,模型必须猜测创作者预期的运动幅度、透视变形以及遮挡关系的演变。而 Atlas 则彻底颠覆了这种基于纯文本的黑盒猜测机制,它能够直接接收相机在三维坐标系中的精确位置坐标(Position)与朝向角度(Orientation)。创作者只需向系统提供一张或多张参考图片,并明确指定相机在三维空间中的新位置,Atlas 便能严格遵循底层的几何约束,渲染并生成对应视角的全新画面。
这种控制维度的升维,对于影视制作、三维虚拟制作以及专业内容生产管线具有颠覆性的工程意义。指定相机在三维空间中的位姿是一组完全可数学检验、可确定性度量的物理与几何约束。创作者可以在渲染输出后,精确比对生成的镜头视锥是否丝毫不差地抵达了预定坐标。对于需要进行复杂分镜衔接、反复打磨修改并保持场景绝对一致性的生产流程而言,这绝不仅仅是控制精度有所提高的量变,而是质的飞跃:创作者终于能够将同一个生成环境视作一个具有持久确定性、可被反复调用的三维场景资产,彻底告别了以往每一次调整都必须重新在扩散模型中随机抽取一段视频片段的不可控状态。
进一步地,创作者不仅能指定单个离散的视角,更能够将一条条复杂的连续相机路径(Camera Path: 相机在三维空间中随时间连续运动的几何轨迹)直接输入到生成流中。创作者可以针对镜头设计出包括前进推轨、绕轴旋转、急速转向在内的各种具体运动轨迹,而无需依赖“镜头缓慢推进”、“从高空俯瞰”等语义模糊的形容词。Atlas 会严格沿着这些定义在三维坐标系中的平滑几何轨迹生成时间与空间高度连贯的画面。
更为关键的是,这种基于显式几何位姿的空间控制能力还可以无缝扩展至多张参考图像。当用户向系统输入两张分别对应空间中不同物理坐标的图像时,Atlas 能够将它们统一映射并锚定在同一个共享的三维空间上下文中,进而自动计算并生成连接这两张图片所缺失的物理与视觉内容。在 World Labs 官方展示的核心案例中,两张原本没有直接关联的室内场景照片被放置在不同的三维坐标点上,Atlas 自主生成了连接这两处空间的门扉、过渡走廊以及相匹配的室内结构。这意味着,参考输入在 Atlas 的体系中不再仅仅是决定最终画面艺术风格的参考调色板,而是直接成为了生成空间中具有确切空间拓扑关系的几何基准点。
在具体的视频生成指标上,Atlas 支持接入一到六张参考图片,配合人工精确设计的相机轨迹,生成最长可达一分钟、分辨率高达 1440p 的超高清视频。制作流程转变为:首先在虚拟空间中确定三维场景结构与相机运动轨迹,Atlas 再根据这些严密的先验几何条件生成整段连续视频。同样的空间控制逻辑还支持在同一个三维场景内探索生成多条截然不同的运镜路线,让虚拟摄影机以不同的移动速度、轨迹长度与复杂转弯半径穿梭于场景的不同区域,而无论镜头轨迹如何剧烈变化,场景中建筑、物体之间的相对几何拓扑关系与光影透视始终保持着极高的一致性。虽然 Atlas 同样具备基于文本提示直接生成二维图片、生成包含复杂文字渲染的画面以及输出 360度全景图 的能力,并广泛覆盖了电影质感镜头、室内建筑设计、游戏美术资产以及童话村庄全景等丰富风格,但 World Labs 强调,Atlas 最本质的底层差异化优势在于,所有这些视觉产物的生成,无一例外都深深扎根于坚固的三维空间关系底座之上。
空间重建机制:所见越丰富则所想越收敛
如果说相机控制生成解决的是利用空间先验从已有信息中向外拓展并合成全新视角的画面,那么空间重建(Spatial Reconstruction: 基于二维视觉观测恢复三维场景几何结构与辐射场信息的过程)解决的则是将现实物理世界的真实空间高保真地还原进数字世界。Atlas 展现出了极具弹性的空间重建架构,能够从一张或多张真实世界拍摄的照片中精准反求并重构出完整的三维场景。
在这个空间重建的演进过程中,输入信息的充沛程度与模型自主生成的推测程度之间呈现出高度可控的反比动态关系:输入的参考照片越少,物理传感器捕捉到的真实几何线索就越有限,模型需要依靠其内化常识自主补全的外推区域就越大;而随着输入的真实图片数量逐步增加,模型获得的三维空间几何约束就越发完备,其需要脑补与推测的部分便会相应收敛。World Labs 通过包含花园、房屋与小屋的典型场景极其清晰地展示了这一机制的运作逻辑:当模型仅接收到单张花园照片时,Atlas 能够忠实重建出照片中花园的几何与外观,但围绕花园周边的广阔环境仍需模型根据通用场景先验进行推测补全;当研究人员追加第二张小屋照片时,花园与小屋在三维空间中均与真实输入精准对齐,剩余盲区依然由模型平滑补全;而当进一步追加第三张房屋照片后,整个复合场景便获得了近乎完整且严格忠实于物理现实的还原。
World Labs 将这套优雅的空间重建收敛逻辑精辟地概括为一句话:“模型看到得越多,需要想象的就越少。” 在大多数日常物理场景中,通常仅需两到三张不同角度的照片,Atlas 就能输出一套几何保真度极高的三维重建结果;而在面对超大规模复杂场景时,Atlas 最大可同时吞吐并利用超过一百张高分辨率图像作为输入空间上下文。
在理解这一空间重建能力时,必须在工程认识上厘清一个关键的技术细节:生成在视觉上显得合理自然,并不等同于它在客观物理世界中就百分之百真实存在。在 Atlas 的空间重建体系中,凡是被输入相机真实拍摄并覆盖到的区域,模型执行的是严格的真实空间信息高保真还原;而对于光学视锥未曾拍到的视线盲区与遮挡背面,模型则是在空间几何先验的指引下,根据物理常识与上下文线索进行合理的生成式补全。为了满足测绘、高精度三维建模等专业工程对真值(Ground Truth)的严苛要求,Atlas 甚至允许用户在系统设置中完全关闭想象补全模式,强制模型仅对真实像素所覆盖的区域执行确定性的高精度几何重建。
为了印证该模型在处理超大规模场景时的几何组织能力,World Labs 公布了一个极具视觉与工程冲击力的标杆案例——斯坦福大学主方庭(Stanford Main Quad)的三维全景重建。在整个重建任务中,Atlas 仅仅接收了二十五张由研究人员站在地面常规视线高度拍摄的离散照片,就成功在统一的三维坐标系中构建出了完整的大学核心建筑群空间。随后,模型直接生成了一条从斯坦福校园数百米高空疾速掠过、俯瞰整个主方庭的远距离飞行航拍轨迹视频。从正门入口处开阔平整的中央草坪,一直到纪念教堂(Memorial Church)外立面上细致入微、复杂繁复的马赛克壁画装饰,所有建筑的尺度比例、空间相对方位与细节纹理都被极其规整地统一组织进了同一个三维空间中,展现了极其惊人的跨尺度几何一致性与场景拓扑泛化能力。
几何结构与动态时空:高斯泼溅与子弹时间重构
在空间数据表达层面,Atlas 的重建产物绝不仅仅停留在生成一系列二维新视角渲染图的表层,它能够直接输出底层显式的点云(Point Cloud: 三维坐标系中离散空间点集合的几何表示)以及先进的 3D高斯泼溅(3D Gaussian Splatting: 基于高斯椭球的三维场景实时辐射场渲染表示技术)资产。当仅给模型输入单张静态图片时,Atlas 能够在生成多视角画面的同时,端到端地同步预测并输出对应的三维空间稠密几何结构;而当输入一段在真实物理空间中手持拍摄的连续视频时,Atlas 会精准预测视频中每一帧画面的深度图(Depth Map),进而将海量的空间几何信息与纹理特征深度融合为高精度的 3D 重建场景。
对于物理拍摄中因视角受限而未被覆盖到的空间死角,Atlas 能够利用其生成式先验智能补全点云中的缺失空洞,将其缝合成一个致密完整、毫无视觉破绽的高斯泼溅辐射场场景。World Labs 官方指出,这套输出的高斯泼溅三维模型具备极高的渲染运行效率,能够直接在消费级终端设备上以超高分辨率与高帧率实现实时交互式漫游渲染,这一技术特性也与其商业化落地产品 Marble 形成了深度的管线协同与资产互通。
在牢固确立了静态三维空间的几何表征之后,Atlas 进一步将建模维度拓展到了包含时间轴的动态连续物理事件中。World Labs 在发布会中展示了一个高度致敬经典科幻电影《黑客帝国》的子弹时间(Bullet Time: 围绕时间冻结或极度慢动作的物理动态事件进行全方位自由视点旋转的视觉特效)重构案例。在传统视觉工业体系中,捕捉这种高动态的多视角自由视点视频通常需要依赖极其昂贵的专业动作捕捉棚、由数十乃至上百台高帧率工业相机组成的精密同步阵列以及极其繁琐的时钟同步硬触发硬件系统。
然而,World Labs 的研究人员彻底摆脱了对专业重型设备的依赖,仅仅使用了三到五台市面上最普通的智能手机或运动相机,随意架设在几个大致方向上,从不同视角同步拍摄了一段物理动态事件。Atlas 随后在算法层面自动完成了多路视频的非线性时间轴对齐与空间位姿标定,在内部构建出高维动态时空模型。在事件拍摄完成之后,用户便可以在时间轴的任意瞬间自由漫游,甚至将虚拟摄像机放置在现实世界中根本不存在任何实体摄像机架设的物理坐标点上,全方位凝视并观摩同一个动态瞬间。整个数据采集过程由工程师与研究人员手持普通手机、简易便携三脚架以及可轻松装入背包的小型夹具即告完成,这表明空间智能技术正在以前所未有的速度大幅降低高动态自由视点视频的采集门槛。
虚实迁移闭环:面向机器人具身智能的仿真底座
动态时空建模与精准几何推断能力的成熟,顺理成章地为通用机器人与具身智能(Embodied AI: 拥有物理实体并在三维物理世界中进行自主感知、决策与物理交互的智能系统)开辟了一条通向工业落地的全新路径。在从现实到仿真(Real-to-Sim: 将真实物理世界的传感器观测数据与几何环境逆向转换为可计算数字仿真环境的技术)的核心研发流程中,Atlas 展现出了构建高保真仿真基座的巨大工程潜力。
在这一管线中,Atlas 首先利用现场采集的一段真实环境短视频,在几秒内逆向重构出精确的三维物理空间;随后,当虚拟环境中的自主移动机器人在该重建场景内规划路径并穿梭移动时,Atlas 能够实时渲染并生成机器人机载 RGB 摄像头与深度传感器在当前位姿下所应观测到的真实视觉观测与空间深度流。World Labs 重点展示了针对两个大型复杂物理环境的重建案例,令人惊叹的是,每个宏大复杂的场景仅仅提取了手持手机视频中的区区二十四帧离散画面作为空间锚点,Atlas 就完成了高保真环境的重建。在此基础上,算法团队可以随意在虚拟环境中配置具有不同轮廓、传感器高度与运动学约束的机器人模型,模拟它们沿着多样化的复杂路径自主巡航,并实时生成完全符合机器人物理视角的传感器观测数据流。
除了大范围的自主移动导航,针对机械臂在台面上进行的精细化机器人操作任务(Robotic Manipulation Task: 涉及机械臂抓取、装配、旋转及工具使用等物理接触与力学交互的控制任务),Atlas 同样提供了极具价值的仿真数据辅助生成能力。Atlas 能够从极少量的真实物理操作录像中,辅助快速建立机械臂操作仿真资产,并能有效解析与处理刚性物体(Rigid Objects: 形态不可压缩变形的固体)、带有关节约束的铰接物体(Articulated Objects: 如抽屉、柜门、剪刀等具机械联动约束的构件)以及可变形物体(Deformable Objects: 如线缆、布料、海绵等柔性介质)。
一旦高保真虚拟仿真环境建立完毕,研发人员便可以在数字空间中低成本、高并发地动态改变目标物体的摆放坐标、调整机器人的机械臂运动轨迹、切换环境光照条件以及替换背景干扰元素。基于同一个真实世界的物理采集样本,Atlas 可以衍生并合成出成千上万种不同边界条件与扰动因子的极端工况场景,为深度强化学习算法与机器人策略网络(Policy Network)的大规模并行训练与泛化性压力测试提供了近乎无限的数据燃料。
统一序列建模:多模态自回归扩散Transformer架构
面对 Atlas 在高保真视角生成、三维几何重建、时空动态冻结以及具身机器人仿真等多任务维度展现出的全能表现,一个极具探讨价值的系统架构问题随之浮现:究竟是怎样一种底层神经网络架构,能够在一个统一的模型中同时驾驭几何生成、逆向空间重建与高维物理仿真等异构任务?
World Labs 官方揭示了这一核心技术底牌:Atlas 是一个从零开始完全重新设计并联合训练的多模态自回归扩散Transformer(Multimodal Autoregressive Diffusion Transformer: 融合自回归序列上下文组织机制与连续流扩散去噪能力的大型多模态基础架构)。该模型目前支持原生吞吐文本提示词、多视角二维图像、连续动态视频、相机外参位姿矩阵(Camera Poses)以及稠密三维深度图。与仅在离散像素空间进行时空堆叠的传统视频大模型截然不同,Atlas 将文本 Token、图像特征 Patch、六自由度相机位姿以及 3D 深度图等完全不同模态的异构数据,全部映射并排布进同一个统一的 Transformer 序列上下文之中。
在此架构下,序列中的每一张二维视觉图像与深度图,都会在底层与一个具有精确数学定义的显式相机位姿紧密绑定,共同构建出一个全局共享的三维空间感知上下文。用直观的工程语言来理解:Atlas 不仅能够深度解析出“输入图像中包含哪些物体”,更在底层几何张量中明确编码了“这张图像是在三维物理空间的哪一个坐标、以怎样的俯仰角和偏航角捕捉到的”。因此,当模型在序列后方自回归地生成新视角的视觉内容时,它能够同时以输入内容的语义特征与其在全局三维坐标系中的相对空间几何关系作为联合先验条件。
在数据流层面,连续视频在 Atlas 内部被统一表示为离散的时间-空间图像序列,而各类下游任务则被结构化编码为不同的数据输入序列模式。在自回归生成阶段,输入序列在前,目标输出序列在后,模型严格依赖前序已确立的几何与视觉状态,逐个自回归地预测并生成后续的空间元素。而在底层的连续像素与深度生成阶段,扩散模块则采用了业界领先的整流流(Rectified Flow: 依靠直线常微分方程轨迹优化传输路径的连续流生成算法)框架,研发人员可以通过灵活调节去噪步数(Denoising Steps),在极速推理渲染与极致几何画质之间达成最优的工程性能平衡。
以 Transformer 作为核心骨座,使得 World Labs 能够充分汲取并整合大语言模型、图像生成模型以及通用视频生成模型沉淀下来的工业级优化红利:
- 在自回归序列侧:Atlas 能够全面引入针对大型语言模型高度成熟的 键值缓存(KV Cache: 存储注意力机制历史键值对以加速自回归推理的显存优化技术)、缓存感知动态路由以及模型服务分离式解耦架构(Disaggregated Serving),大幅压缩长上下文长序列推理时的显存占用与计算时延。
- 在连续扩散生成侧:系统深度融合了扩散蒸馏(Diffusion Distillation: 将多步去噪网络压缩至极少推理步骤的模型轻量化技术)、无分类器引导(Classifier-Free Guidance, CFG)、偏移噪声调度(Offset Noise Scheduling)以及高性能变分自编码器(Variational Autoencoder, VAE)等前沿图像生成优化方案。
量化基准评测:空间控制与几何精度的实证优势
为了向学术界与产业界证明其架构设计的优越性,World Labs 官方公布了 Atlas 在相机路径控制生成与三维空间重建两项核心基准上的量化评测对比数据。
第一项量化基准针对相机控制生成能力展开。测试协议向待评测模型输入一张静态参考图片,并要求模型严格遵循给定的指令,生成包含一至三种经典电影级运镜轨迹的视频片段,具体涵盖了横向平移(Pan)、前后推轨(Dolly)以及垂直升降(Pedestal)等镜头组合。在该测试中,Atlas 直接接收显式定义的三维空间相机运动轨迹坐标流;而对于当前主流的视频生成模型(因其原生不支持空间几何位姿输入),则通过精心编写的自然语言提示词来精准描述相同的运镜要求。随后,评测组织了独立的第三方人工盲测评估,由评测人员客观裁定生成的视频片段是否在透视与视线上更精准地复现了预定的相机运动轨迹。
人工评测统计得票率结果如下:
- 相比于 MiniMax H3,Atlas 赢得了 75% 的偏好得票率;
- 相比于 Gemini Omni Flash,Atlas 获得了 81% 的得票率;
- 相比于 Happy Horse 1.1,Atlas 斩获了 86% 的得票率;
- 相比于 FLUX 3,Atlas 的偏好率攀升至 93%;
- 相比于 Seedance 2.5,Atlas 更是取得了高达 94% 的压倒性优势。
World Labs 官方分析指出,测试中规划的相机运动轨迹越复杂、空间转折越剧烈,Atlas 依托空间坐标锚定所展现出的几何连贯性优势就越发显著。然而,从严谨的工程测评角度出发,必须补充说明的是:由于 Atlas 在此项测试中直接读取了底层无损的三维空间相机轨迹数据,而其他对比模型仅能依赖文本语义转译进行模糊推断,这种输入条件的非对称性在客观上构成了 Atlas 的功能壁垒,但同时也意味着该项测试并非完全在同等条件下的纯视觉生成质量对比,而是凸显了显式空间输入通道对于视觉生成的绝对控制优势。
第二项量化基准聚焦于三维点云重建几何精度。测试向待测模型输入一组附带精确相机位姿信息的照片,要求模型逆向预测并还原输入图像中每一个像素点所对应的真实三维空间物理坐标。对比基线涵盖了当前三维视觉领域的代表性模型,包括 Pi3X、π立方(Pi-Cubed)、VGGT-Ω 1B、Depth Anything 3 以及 MapAnything。
依据行业通行的标准化测试协议,Atlas 在该基准上交出了一份优异的成绩单:
- Atlas 的平均点图重建误差(Average Pointmap Error: 衡量预测三维点云与真实空间点云几何偏差的核心指标)仅为 25.3‰(千分之二十五点三),在所有参评模型中位列最低(该数值越小代表空间几何还原度越精准)。
针对整体能力评测,World Labs 保持了客观克制的态度,并明确表示世界模型的内涵极其庞大,横跨视觉渲染、几何空间重建与物理世界交互仿真等多个维度,目前行业内根本不存在单一的综合指标能够完整度量其全貌。因此,公司现阶段选择重点公布相机精确控制生成与三维空间重建这两项具备确定性量化标准的实证数据。
除了静态基准评分,World Labs 还在报告中着重强调了 Atlas 展现出的扩展法则(Scaling Law: 模型性能与能力随训练算力、数据规模及参数量呈幂律增长的经验法则)特性。在研发过程中,团队设计并训练了不同参数量级与不同训练计算浮点预算的 Atlas 变体模型,实验结果清晰表明:伴随着训练算力与有效数据规模的持续扩张,模型在空间拓扑泛化与多视角几何一致性上自发涌现出了更高级别的推理能力,有力证明了这套以空间为核心的多模态架构同样遵循 Scaling Law,为未来更超大规模世界模型的演进奠定了工程可行性。
范式分野:搭景师与导演的根本逻辑差异
剖析完架构与数据,一个极具行业深度的核心命题随之展开:以 Atlas 为代表的空间智能世界模型,与以 Seedance 为代表的主流视频生成大模型,在底层哲学与实现路径上究竟有着怎样的本质分野?
尽管 Atlas 同样构建在广为人知的 Transformer 基础架构之上,但它与 Seedance 这类主流视频生成模型的生成范式存在着根本性的技术分野,两者的能力维度几乎呈现出九十度的正交垂直状态。如果运用一个通俗的影视工业比喻:Seedance 类的视频生成大模型更像是一位才华横溢的“电影导演”,它最关心的核心命题是“一段戏剧性的视觉画面该如何随着时间轴平滑而自然地演变下去”;而 Atlas 则更像是一位恪守几何法则的“三维搭景师”,它的首要任务是在生成任何画面之前,必须先在虚拟世界中搭建出一套在三维空间中从任何视角、任何角度审视都绝对自洽且说得通的物理场景底座。
深入到数据拟合机制来看,Seedance 类的视频模型通过对互联网上海量二维连续视频画面的密集学习,其神经网络深刻内化并掌握了人类如何优雅转身、水流在重力下如何飞溅波荡、影视镜头如何推拉摇移,以及前后两帧像素之间该如何平滑过度等动态经验。它们本质上紧紧围绕着物理实体的运动交互与时间维度的连续演变展开建模。
反观 World Labs 的技术脉络,在 2024 年展示的初代世界模型中,其核心逻辑恰恰处于完全相反的维度:初代模型从单张照片出发,将其沿深度方向反投影并外推为一个支持自由漫游走入的三维空间。当用户操控虚拟摄像机切换到一个全新的视角坐标时,模型会根据场景语义,自动脑补出原图未曾拍到的墙面纹理、转角走廊以及物体的几何背面。初代模型根本不关心下一秒钟的世界会发生怎样的物理变化,它只在乎用户在走到那个未被拍摄的物理角落时究竟会看到怎样的空间结构。因此,初代 World Labs 模型构建的世界更像是一套极度精致的静态实景摄影棚布景——三维空间已然稳固确立,但物理世界的“时间齿轮”却从未真正启动,公开演示中也未曾展示过任何物体相互碰撞弹开或用户交互实时改变未来的动态闭环。
如今发布的 Atlas 相较于初代模型在综合性能上实现了巨大的跃迁,但其底层的技术主线依然保持着清晰的延续性:
- 输入维度的广度扩展:初代模型主要依赖“单图生成单一世界”,而 Atlas 进化为能够同时吞吐文本、多张参考图、动态视频、精确相机外参以及深度信息;
- 多源线索的空间聚合:Atlas 不再孤立地依赖单张图片去盲猜整个宇宙,而是将来自不同设备、不同角度、不同时刻的离散线索无缝拼接在统一的空间坐标系内,逐步迭代补全同一个场景;
- 架构底层重构:这并非对旧架构的简单参数放大,而是彻底重写并训练了一套通用的多模态几何底座。
然而,客观审视 Atlas 目前公布的所有演示案例,我们依然难以观察到真正由模型端到端“实时物理生成”而非“依靠预先拍摄好的多机位数据重组”的时间性动态演变与复杂物理交互:
- 惊艳的子弹时间特效,归根结底依赖于预先同步录制好的三到五路真实视频进行时空对齐;
- 在三维场景向外无限扩展生成时,时间轴往往需要被动“暂停”以等待空间补全渲染,这表明 Atlas 当前的运行机制更倾向于“在三维坐标中离散地生成一个空间块,再将其物理拼接到已有场景中”,而非维持一个在底层持续运转、自发演化的连续动态世界;
- 在具身机器人仿真层面,Atlas 的主要贡献在于构建高保真、可交互的虚拟静态与半静态环境,而非由神经网络原生预测刚体剧烈碰撞后的动态力学演变;
- 贯穿系统的自回归 Transformer 机制,目前主要扮演的是“预测下一相机位姿下的空间视觉观测”,而非“预测下一物理时间步的复杂世界状态”。
因此,以 Seedance 为代表的视频生成派系与以 World Labs 为代表的空间智能派系,就如同从一条大河的两岸同时开工修建同一座跨江大桥:一端从时间的连续流动出发,拼命想要补齐三维空间的几何一致性;另一端则从坚固的三维空间出发,正努力为静止的布景注入时间的动力学。在当前的工程技术节点上,从时间出发的路线与从空间出发的路线,尚未在终点完成真正的历史性合流。
竞局演进与统一愿景:渲染器、模拟器与规划器的收敛
将视线投向全球技术竞争的宏观格局,Atlas 绝非过去一年中行业内涌现的孤立产物。在世界模型这一兵家必争的前沿赛道上,科技巨头与顶尖科研机构早已展开了多维度的激烈交锋:
- 2025年8月,Google DeepMind 重磅发布了 Genie 3,能够直接根据单句文本提示词,实时端到端生成分辨率达到 720p、帧率为 20-24 帧的可交互虚拟世界,并在数分钟的玩家持续交互操作中保持底层环境与物理机制的基本一致性;
- 2025年11月,World Labs 自身推出的 Marble 平台已经支持接入文本、图像、视频以及粗略的 3D 空间布局,一键生成支持全自由度探索漫游与高精度资产导出的三维交互世界;
- 2026年6月,英伟达(NVIDIA)强势推出了 Cosmos 3,宣称采用统一架构原生吞吐语言、图像、视频、音频以及机器人底层控制动作,将世界模型的模拟能力全面推进至物理AI(Physical AI: 具备物理规律认知并能控制实体执行机械功的具身智能体系)的纵深地带。
面对各家厂商对“全球首个多模态世界模型”这一桂冠的争夺,从严谨的行业技术定义来看,这一概念目前在学术界与工业界依然存在定义维度的讨论空间。World Labs 此前就曾将 Marble 冠以多模态世界模型之名,而英伟达同样将 Cosmos 3 确立为全模态物理世界模型的标杆。
关于世界模型的终极形态,李飞飞与 World Labs 团队在今年六月的行业分享中曾提出过一个极具指导意义的三分法分析框架,将现阶段探索世界模型的技术力量划分为三大功能支柱:
- 渲染器(Renderer: 专注于在二维屏幕上呈现高逼真度、高视觉质感与光影艺术表现的视觉发生器,典型代表为前沿视频生成模型);
- 模拟器(Simulator: 专注于在底层构建精确的三维几何拓扑、材质力学参数、碰撞动力学与物理规律的计算引擎);
- 规划器(Planner: 专注于理解环境状态、进行逻辑推理并为具身智能体输出下一步长周期行动决策的认知大脑)。
World Labs 团队当时旗帜鲜明地指出,世界模型研究的终极圣杯,必然是将这三个相互割裂的技术方向,在底层完全重构并收敛至一个大一统的端到端世界模型之中。毫无疑问,新发布的 Atlas 正是 World Labs 朝着这一终极愿景迈出的极具实质意义的一大步。在系统架构上,Atlas 已经成功打通并兼具了渲染器的高画质视觉生成能力与模拟器的三维几何空间构建能力。然而,平心而论,若以“真正毫厘不差地模拟真实物理世界运行规律”这一严苛标准来审视,当前的 Atlas 距离完全体形态仍然存在着肉眼可见的工程距离。
团队基因与演进脉络:从NeRF先驱到实时帧模型
理解 Atlas 的技术路径突破,必须深入剖析 World Labs 创立背后的科学家团队基因与其清晰的技术演进谱系。
2024年初,斯坦福大学教授、前斯坦福人工智能实验室主任李飞飞,携手贾斯汀·约翰逊(Justin Johnson)、本·米尔登霍尔(Ben Mildenhall)以及克里斯托夫·拉斯纳(Christoph Lassner)共同创办了 World Labs。这支全明星创始团队的底层学术沉淀,高度聚焦于计算机视觉、三维神经辐射场(NeRF)、可微分渲染与计算图形学的前沿交汇处,而非传统大语言模型的文本统计领域:
- 本·米尔登霍尔(Ben Mildenhall):三维视觉领域的里程碑级研究——神经辐射场(Neural Radiance Fields, NeRF: 利用多层感知机隐式神经隐式表达复杂场景连续体积辐射场与新视角合成的开创性工作)开篇论文的第一作者之一。这一学术背景直接奠定了 World Labs 从成立伊始便将“基于神经网络构建连续三维空间表示”刻入底层算法基因的关键基调;
- 贾斯汀·约翰逊(Justin Johnson):长期深耕于视觉推理、多模态图文对齐、二维/三维跨模态生成与空间推理领域;
- 克里斯托夫·拉斯纳(Christoph Lassner):长期致力于高效三维场景表征与超高速可微分渲染架构研发,曾主导开发了被 PyTorch3D 正式采纳为核心球体渲染后端的 Pulsar 渲染引擎(拉斯纳目前已公开宣布卸任公司的日常全职运营管理,转任公司战略技术顾问)。
梳理 World Labs 自成立以来的公开技术研发时间线,可以清晰地看出其战略推进的稳健节奏:
- 2024年9月:早期领投机构 Radical Ventures 正式披露,World Labs 从立项之初就将终极使命锚定在“感知、生成与实时交互三维物理世界”,并制定了先从服务创作者的虚拟三维资产工具切入、再逐步迭代泛化能力的商业与技术演进路线;
- 2024年12月:公司首次对外展示了可以在标准 Web 浏览器端流畅探索漫游、具备高度时空持续性的原生 3D 世界生成原型;
- 2025年9月:研发重心全面转向更大尺度、更丰富细节的复杂场景生成,商业化核心产品 Marble 启动早期内测;
- 2025年11月12日:Marble 正式向全球所有开发者与创作者公开发布。Marble 的核心产业价值在于将实验室中的前沿论文算法转化为了创作者可以直接导入生产管线的实用生产力工具——用户不仅能通过文本、图片、视频与粗粒度三维白模生成世界,更能在网页端自由执行编辑、空间外推扩展、场景拼接合并,并直接一键导出工业标准的 3D 高斯泼溅、Mesh 几何网格资产或高清视频序列,真正实现了三维资产的“可编辑、可调整、可交付”;
- 2025年10月:在推出 Marble 的同时,团队公布了另一条至关重要的底层研究主线——实时帧模型(Real-Time Frame Model, RTFM: 从已有画面预测新视角的学习型渲染架构)。RTFM 旨在探索完全由神经网络学习而来的端到端神经渲染器,抛弃了传统计算机图形学必须预先经过显式网格建模、UV 展UV、贴图材质绑定、光照烘焙才能计算最终像素的繁琐链路,直接从历史已观测画面与相机位姿预测生成下一帧视角,其核心工程目标是在单张 NVIDIA H100 算力卡上达成流畅的交互式渲染帧率。
在 RTFM 的架构探索中,研发团队攻克了最核心的空间记忆机制挑战:假设用户在虚拟房间中从客厅漫步到厨房,随后再次折返回到客厅,系统绝对不能在用户折返时重新随机臆造出一个全新的客厅。如果将用户此前浏览过的所有历史长序列视频帧毫无节制地全部塞入注意力上下文,显存与计算开销将呈灾难性爆炸。RTFM 的核心解决方案是为每一帧画面打上显式的空间三维坐标锚点,当相机移动到新视角时,注意力系统仅需在空间局部检索附近物理坐标的关键帧进行条件生成,而无需全局处理海量冗余历史。这一优雅的“空间化记忆组织”思想,在如今发布的 Atlas 中得到了完美的继承与全面发扬——上下文不再是单纯按物理时间先后堆叠的一维线性流,而是包含了“从空间的何处视角、观测到了何种信息”的结构化高维空间记忆;
- 2026年1月:公司进一步推出了 World API 开发者接口,允许全球企业与软件开发者通过标准的 RESTful/gRPC 编程接口直接调用其背后的三维世界生成能力,标志着 World Labs 实现了由“算法研究演示”向“模型-创作套件-开发者生态接口”三位一体工业级平台的全面蜕变。
仿真现实差距:从视觉合理迈向物理真确的漫长征途
为了将空间模型底座全面推进至物理闭环的最前线,World Labs 在今年七月完成了对机器人技术创新企业 SceniX 的战略收购,将“学习型仿真系统与真实机器人物理闭环”确立为公司未来最重要的战略攻坚阵地。收购完成仅一周后,公司便迅速公布了其在 Real-to-Sim-to-Real(现实采集到仿真训练再到真实机器人部署验证)技术链条上的阶段性突破:利用 Atlas 级空间底座将现实世界中的复杂作业任务自动逆向编译为物理参数完全可控的虚拟仿真环境,在云端大规模并行训练强化学习策略网络,最终一键下发至真实物理实体机器人进行无缝验证。官方公布的真机实测案例覆盖了高难度的柔性线缆插拔与整理、高精度生物试管移液分装以及在高度杂乱环境下的随机物体自主抓取,并在部分严苛的实机工业测试中达成了连续运行一小时以上完全无需人工干预介入的优异表现。
从具身智能与先进制造的产业宏观视角来看,World Labs 正在争夺的绝不仅仅是机器人大脑的规划推理能力,更是在全力争夺机器人策略在走向物理世界之前进行千万次试错练习与严格应试的虚拟考场定义权。在严苛的现实物理世界中,机械臂或双足机器人的每一次抓取失败或碰撞跌倒,都不可避免地伴随着昂贵硬件的机械磨损、电机过载风险以及耗时费力的人工场景重置复位成本。如果高保真仿真环境能够高置信度地精准预测现实物理系统的响应表现,研发团队便能将 99% 的试错成本与策略收敛过程转移到云端无风险的虚拟空间中高速完成,仅需动用极少量的实机时间对最终筛选出的最优策略进行收敛性验证。
然而,在这个看似完美的商业叙事背后,依然横亘着一道世界模型与具身智能领域迄今无法回避的深水区挑战——仿真与现实的差距(Sim-to-Real Gap: 虚拟仿真环境中的物理计算规律与真实世界复杂非线性力学特性之间的偏差与失真)。在利用生成式世界模型构建机器人训练基准时,最隐蔽也最危险的技术陷阱恰恰在于:一个在视觉感知上看起来极度自然、毫无瑕疵的生成画面,在底层的经典力学与动力学规律上却极有可能是完全失真与谬误的。
一段视频在人类肉眼审视下显得符合常识,绝不自动代表它能直接充当高可靠性的机器人强化学习训练沙盒。以最基础的机械手抓取玻璃杯任务为例:影视级视觉渲染管线只需要保证机械手指在画面中与玻璃杯表面贴合平滑、光影交互显得自然即算完成任务;但对于机器人强化学习控制算法而言,物理仿真引擎必须以严苛的数值精度准确回答:
- 当机械手抓取接触点发生一毫米的微小偏移时,静摩擦力与法向接触力是否会导致杯体发生旋转滑落?
- 当机械臂末端加速度突变时,杯内液体产生的晃动惯性力矩是否会导致姿态失衡?
- 在虚拟仿真环境中千锤百炼优化出的控制策略,在面对真实世界中存在微小表面油污、材质刚度差异或电机响应延迟的真机时,其任务成功率能否稳定迁移而不发生崩溃?
生成一万个在视觉上逼真无比的虚拟房间,绝不自动等价于为具身智能工程师提供了一万个可以直接用于策略收敛的有效物理训练场。
在客观审视 Atlas 当前的技术成熟度时,必须保持清醒而理性的工程认知:
- 模型核心技术参数未公开:World Labs 官方目前尚未正式披露 Atlas 的具体模型参数量级、预训练数据集配比构成、具体的算力训练消耗(FLOPs),亦未向开源社区公开发布模型权重;
- 缺乏第三方独立基准测评:当前 Atlas 仍处于面向极少数特邀行业战略合作伙伴的早期受限访问测试阶段(Early Access),其公布的所有优异性能基准与对比胜率,主要来源于 World Labs 自身研发团队撰写的研究报告,尚待全球独立第三方学术实验室与开源社区进行广泛、可复现的交叉验证;
- 物理动力学边界尚待突破:Atlas 现阶段展示的核心优势依然集中在三维空间几何表征、多视角视觉生成与半静态环境的构建上,在应对剧烈碰撞检测、非线性摩擦力学、复合流体与连续介质动力学以及长时间跨度下的多体物理演化等硬核物理模拟上,尚未展现出系统性的理论与工程突破。
因此,在现阶段,我们尚不能简单地将 Atlas 称作一个已经完全能够准确预测物理现实万物运行规律的终极世界模拟器。但毫无疑问,Atlas 的横空出世为整个人工智能行业指明了一条越来越清晰的技术演进范式:过去的二维视觉生成模型,仅仅学会了如何在抽象的潜空间中根据历史像素去概率性地预测下一组像素;而新一代空间智能世界模型,正在以三维几何为锚,坚定地尝试回答一个更为宏大且直击本质的物理世界命题——“当摄像机或智能体移动到物理世界中的另一个全新空间坐标时,我们将目睹什么;而当一个物理实体在这个三维世界中施加作用力并开始运动时,接下来又将确凿地发生什么。”