从“猜画面”到“建空间”:Atlas让世界模型走出实验室
创始人
2026-09-03 17:00:56
0

当地时间2026年9月1日(北京时间9月2日),World Labs发布了一款名为Atlas的模型。团队官方的定义是“全球首个多模态世界模型”,但实际演示中它做的事情可以概括得很朴素:给它几张普通照片,设定好镜头轨迹,它就能生成长达一分钟、1440p分辨率的高清视频,镜头角度和运动路线完全由你控制。输入一张只拍到正面的机器人照片,它能补全人背后的场景——墙壁、窗户、桌角,仿佛那个空间本来就存在。

技术圈很快把它和Sora放在一起比较。但Atlas值得被单独讨论,不是因为它生成视频的长度或清晰度又刷新了纪录,而在于它选择了另一条路——不再满足于“生成好看的画面”,而是试图让AI真正理解三维空间长什么样、物体之间的位置关系如何、镜头转过去之后应该看到什么。

这个转变,指向的是一年以来被反复讨论、却迟迟没有落地的概念:世界模型。

一条被挤爆的赛道和一个被低估的方向

过去一年,AI视频生成几乎是整个行业最拥挤的赛道。从科技巨头到创业公司,每隔几周就有一个新模型发布,你追我赶地刷新分辨率、时长和画面真实感。但无论画面多精致,这些模型本质上做的还是同一件事:把文字提示转换成看起来合理的二维像素排列。

它们不知道画面里的椅子在三维空间中应该多大、桌子在椅子前面还是后面、镜头转到背后会不会露出一片空白。因为训练数据本身是二维的图片和视频,模型学到的只是“什么颜色的像素块通常挨着什么颜色的像素块”。画面可以很逼真,但空间是错的——镜头一拉,桌子跟着转,墙上的画莫名其妙飘在半空。

Atlas试图回答一个更根本的问题:AI能不能不要只猜像素,而是先理解空间再生成画面?它的做法是,把每一张输入图片都锚定在三维空间中的精确位置,附带相机位姿和深度信息。这相当于给了模型一个带坐标轴的三维草稿本。在此基础上,它以多模态自回归扩散Transformer为底座,原生处理文本、图像、视频与3D四类数据——相机位姿与深度信息即属于后者。

效果上最直观的差异体现在“镜头控制”。用传统视频模型,你想让镜头左移、环绕或升降,只能在提示词里写电影术语,然后祈祷模型理解你的意思。Atlas直接把“相机位姿参数”做成原生输入,你要什么角度、什么轨迹、走多快,直接给坐标。World Labs管这叫“坐进导演椅,而不是在拉老虎机的拉杆”。

这个区别看似技术细节,实际上划出了一条分界线:一边是像素级生成器,一边是空间级理解者。

影视行业的门槛正在松动

Atlas带来的连锁反应,首先会冲击影视制作领域。

传统三维重建是个苦差事。要还原一个真实场景的3D模型,需要扛着激光雷达或深度摄影机围着目标转几十圈,拍几百上千张照片,再花大量算力和人力做后期拼接。在官方演示中,Atlas用2到25张地面随手拍摄的普通照片,就重建了斯坦福大学主方庭等大型场景。在DTU、ETH3D等7个公开数据集上的测试中,它的平均稀疏视角重建误差为25.3‰,优于多个专门做3D重建的模型。

对影视工作者来说,这意味着用几张照片就可以还原一个空间场景。传统拍“子弹时间”特效需要几十上百台相机同时触发,Atlas用普通手机视频就能做到——时间冻结,镜头环绕,周围环境由模型实时补全。影视预演、虚拟制片、特效制作,这些原本需要大量预算和专业设备的环节,门槛正在被拉低。

当然,Atlas目前生成的是一个“视觉上合理”的三维世界,未必是原来那个世界的精确数字复刻。但对影视创作而言,镜头没拍到的地方,AI补出一扇门、一面墙、一条走廊,视觉上连贯就足够用了。

值得注意的是,World Labs并没有把Atlas定位成一个面向消费者的产品。它目前仅向少数合作伙伴开放早期访问,公开结果主要来自官方演示。这家公司更想做的,是给专业创作者和开发者提供一套能理解空间、可交互的底层工具。

机器人的新训练场

比影视行业更值得期待的应用,在机器人领域。

训练机器人需要海量数据。一个机械臂要熟练抓取不同形状、材质、摆放角度的物体,需要见过成千上万种场景。但真实世界的数据采集成本极高——你得布置场景、安装传感器、反复运行、记录数据。传统做法是用专业设备扫描真实环境建立数字模型,费钱又费时间。

Atlas提供了一种新思路。World Labs的演示中,团队用两段手机视频分别重建了两处大型空间,每段只取了24帧,然后让不同机器人沿不同路线在其中移动,生成机器人传感器会观测到的RGB图像和深度数据。一次实拍,就能变出一批不同的训练和测试环境。

李飞飞的学生、英伟达杰出科学家和机器人主管Jim Fan评价说,这是机器人领域Real-to-Sim的一大步。所谓Real-to-Sim,就是用现实拍摄的画面构建仿真训练场,机器人在里面反复训练后再迁移回现实世界。这解决了机器人训练中一个长期存在的痛点:真实数据匮乏。以前训练机械臂抓杯子,得在仿真器里手动搭几百个厨房场景,现在几张照片就能生成一个逼真的三维模拟环境。

不过,Atlas目前还不是万能的。它擅长构建几何连贯的静态空间,官方演示也展示了刚体、铰接体等物体的交互模拟,但这些能力目前均出自World Labs自己,通用物理模拟的精度与可靠性,还要等外部团队的独立实测。对机器人训练来说,台阶高度、障碍物位置和物体运动一旦猜错,错误也会跟着进入训练数据,最后由真机来买单。Atlas究竟能省下多少成本、能产出多少有效训练数据,同样有待验证。

世界模型有了一个看得见摸得着的样本

Atlas的发布,是李飞飞长期理论的一次落地。

早在2024年创办World Labs时,李飞飞就提出一个判断:如果AI没有空间智能,就不可能真正实现AGI。大语言模型让机器学会了遣词造句和逻辑推理,但物理世界运行的底层逻辑完全不同——语言模型学的是文本的统计规律,世界模型学的是时空的统计规律。

2026年6月,李飞飞发表了一篇长文《世界模型的功能分类法》,把世界模型分为三大类:渲染器输出画面、回答“看起来像什么”,模拟器输出可计算的世界状态——几何、物理和动力学,规划器回答“下一步该做什么”。Atlas的定位,正是从“渲染器”向“模拟器”跨越的一步。它不满足于生成好看的画面,而是试图维护一个可测量、可交互的三维空间状态。

这个定位得到了资本市场的认可。World Labs成立于2024年,当年以约2.3亿美元融资走出隐身模式;2026年2月又完成10亿美元新一轮融资,Autodesk领投2亿美元,英伟达、AMD、a16z、富达等跟投,投后估值据公开报道约50亿美元。

李飞飞在Atlas发布后写道,这是团队的“里程碑式成果”。这个措辞值得玩味——不是“终极方案”,不是“突破天花板”,而是“里程碑”。从ImageNet开启计算机视觉革命,到如今Atlas试图让AI理解三维世界,这条路径一脉相承。大语言模型让AI学会了“说话”,世界模型要做的是让AI学会“看”和“动”。

Atlas只是这条路上的一个重要节点。它证明了用多模态信息构建可交互三维世界是可行的,也暴露了距离真正的物理模拟器还有多远。但当AI真正理解空间、时间和物理法则之后会变成什么,现在还远远看不到边界。至少,我们已经看到它迈出了第一步。

相关内容

热门资讯

原创 苹... 有不少朋友疑惑苹果iPhone 16 Pro和16 Pro Max有什么区别?该选择哪一款更好?各自...
2024年OPPO手机全攻略:... 手机已不仅仅是通讯工具,它更是我们记录生活、享受娱乐、提升工作效率的重要伙伴。随着科技的飞速发展,O...
2025年值得入手的2款智能手... 在科技飞速发展的今天,智能手表已成为我们生活中不可或缺的伙伴。无论是健康监测、信息提醒,还是时尚搭配...
原创 2... 从去年华为用上了麒麟芯片开始,华为的市场份额就蹭蹭的往上涨,当时抢购的人特别多,一时间还买不到现货,...
第五轮学科评估对比:西安交大突... 在之前的文章中,我们已经提及西安交通大学第五轮学科评估的表现可圈可点,新晋的3个A+学科:机械工程、...
vivo手机5g开关在哪里打开 vivo手机5G开关的打开方式可能因手机型号、系统版本及运营商网络支持情况的不同而有所差异。但总体来...
原创 麒... 为了普及原生鸿蒙(鸿蒙5.0),抢占更多的中端手机市场份额,华为nova系列今年开始计划一年两更,n...
解决FaceTime无法使用的... FaceTime是苹果公司推出的一款视频通话应用,广泛应用于iPhone、iPad和Mac等设备上。...
steam官网无法访问?这个办... 对于广大游戏爱好者而言,Steam平台无疑是获取最新游戏资讯、购买游戏、与全球玩家互动的重要阵地。然...
原创 直... #热点周际赛# 随着科技的进步,儿童智能穿戴设备逐渐成为了家庭中的新宠。华为作为智能穿戴领域的领军者...