李飞飞 Atlas 发布:从渲染到模拟,世界模型新定义

核心要点

World Labs发布Atlas,引入深度与点云数据,将世界模型从纯视觉渲染升级为可测量的物理模拟器,旨在解决机器人训练中的数据稀缺与Sim2Real鸿沟问题。

据 Woofun AI 消息,9 月 1 日,李飞飞领衔的 World Labs 正式推出 Atlas,通过整合 depth、point cloud 及 3D Gaussian Splat 技术,实现了从单纯视觉渲染向可测量物理模拟的跨越。该系统利用多机位'子弹时间'拍摄手法,不仅生成逼真画面,更赋予场景精确的三维坐标与几何属性,标志着世界模型在机器人应用层面的实质性突破。

世界模型的层级划分并非近期才有的概念,其理论渊源可追溯至 1943 年英国心理学家 Kenneth Craik 提出的观点:人类之所以能预判事件发展,是因为大脑中构建了一个缩小版的现实世界模型。

这一思想随后被控制论、神经网络及强化学习领域继承,并演化为 state(状态)、observation(观测)和 action(动作)三个核心要素。以一间厨房为例,杯子在桌上的位置、桌子离墙的距离、门的开合状态等共同构成了当前的 state;人站在门口只能看到部分场景,被冰箱遮挡的地面或杯中的水量属于不可见部分,眼睛接收到的信息即为 observation;而人走过去推开杯子的行为则是 action。一个系统能够管理这三要素中的哪几项,直接决定了其所属的层级。World Labs 在今年 6 月发表的文章中,据此将市面上的系统明确划分为三级:渲染器、模拟器和规划器。

按照这一分类标准,渲染器仅负责生成画面,它只需确保人往前走一步时,生成的图像与上一帧衔接自然、视觉效果逼真即可,无需知晓杯子的高度或桌子与墙壁的具体距离,因为其输出结果仅是一张供人观看的图片。相比之下,模拟器必须维护世界的全部状态,包括物体的位置、尺寸及物理交互规则,这些数字需随时可调取,以便其他程序(如机械臂控制代码)接入并进行操作。规划器则更进一步,它不仅掌握物体状态及碰撞后果,还需判断何时伸手、先拿哪个物体以及从哪个角度下手最稳妥。基于此标准,Google DeepMind 的 Genie 3 被归入最低一级的渲染器,World Labs 自己在 2025 年 10 月发布的 RTFM 同样属于此类。在此之前,'世界模型'一词常被泛化使用,无论是输入文字生成可探索画面,还是宣称用 AI 模拟世界,都被冠以此名,而 World Labs 的这篇文章首次划清了画面生成与世界模拟的界限。

Atlas 的目标是达到模拟器这一层级,其技术架构被称为 multimodal autoregressive diffusion transformer。这一名称由四个部分组成,其中 transformer 和 autoregressive 源自大语言模型技术,负责根据已生成内容逐帧续写;diffusion 来自图像和视频生成领域,负责绘制画面;multimodal 则指模型同时接收多种输入。Atlas 的创新之处在于 multimodal 具体涵盖了文字、图片、相机位姿和深度图四类数据。

相机位姿记录了拍摄时相机在三维空间中的位置和朝向,由六个数字精确描述;配合深度图,每张照片不再是孤立的图像,而是标定了拍摄位置的三维切片。所有照片被映射到同一套坐标系中,形成 Atlas 的 shared spatial context(共享空间上下文)。例如,从客厅门口和窗边分别拍摄沙发,普通模型会将其视为两张不同的图片,而 Atlas 通过相机位姿数据,理解这是同一个沙发在不同视角下的呈现,从而构建出统一的空间认知。

这种基于位置的数据处理机制,解决了上一代产品 RTFM 在长时记忆上的瓶颈。RTFM 旨在单张 H100 显卡上实时生成可无限探索的世界,但随着用户探索时间延长,若将所有生成画面存入上下文,算力将迅速耗尽;若仅保留最近几十帧,则会导致场景不一致,如绕回厨房时模型已忘记桌子的原始位置。World Labs 为此引入了 posed frames as spatial memory 机制,即每一帧不仅存储画面,还记录拍摄时的相机位置和朝向。当模型需要生成特定位置的景象时,系统无需遍历全部记忆,而是以位置为索引,就近检索相关帧拼凑上下文。

这种按地点检索的方式类似于人类记忆:回想上周三下午的具体活动可能困难,但走进熟悉的会议室,便能迅速回忆起座位分布和白板内容。Atlas 继承了这一逻辑,使空间记忆更加高效且一致。

在生成与重建的融合实验中,Atlas 展示了'the more it sees, the less it imagines'的特性。实验初期,仅凭一张花园照片,模型能还原花园实景,但周围未拍摄到的建筑则依靠训练数据中的常识进行补全;随着更多照片的加入,如拍到旁边的小屋,模型便减少想象,增加真实重建的比例。

Woofun AI 整理数据显示,通常两三张照片即可将场景还原至可用状态,单次最多可输入一百多张照片。这一机制将原本分离的重建与生成两条路径合二为一:重建侧重于按原样还原真实场景,宁可留白也不虚构;生成则依赖模型见过的数据创造不存在的地方。Atlas 则根据输入照片的数量动态调整,照片少时多依赖生成补全,照片多时则侧重真实重建。这与 Funes World 项目形成鲜明对比,后者致力于纯粹的重建,已公开 2100 多个模型,覆盖 19 个以上的国家,旨在为物理世界建立类似 GitHub 的备份档案,坚持'哪怕缺一块,也不能让模型替它补'的原则。而 Atlas 面向的是机器人应用,只要墙壁的位置和尺寸准确,机械臂碰撞的结果即一致,墙面花纹是拍摄还是生成并不影响任务执行。

为了验证这种部分依赖生成的世界模型能否有效训练现实中的机器人,World Labs 在 7 月收购了机器人公司 SceniX,并公布了首批 Sim2Real(仿真到现实)测试结果。几组机器人完全在模拟器中训练,未使用任何真实世界数据,随后直接部署到真实机械臂上,执行装箱、绕线、搬试管等任务。其中几台机器人连续自主运行了 1 小时,全程无人干预。在评估模拟器有效性时,World Labs 摒弃了'模拟器成功率应与真机一致'的传统标准,因为摩擦系数和重量分布的差异必然导致成功率偏差。取而代之的是决策一致性测试:先在模拟器中将几种方案各跑 2000 次,按表现排序,再将方案搬到真机上各跑 100 次,对比两者在方案优劣排序及易失手步骤上是否一致。结果显示,这两项指标均高度吻合,证明有用的模拟器无需复制现实的成功率,只需支持与现实相同的决策逻辑。

这种通过简化物理细节以保留决策结构的思路,在历史上早有先例。1901 年秋天,莱特兄弟依据 Lilienthal 的机翼数据制造滑翔机,发现实际升力仅为预测值的三分之一。由于重新测试需承担人身风险,他们建造了一个六英尺长的风洞,在一个冬天内测试了 100 多种机翼设计。

尽管风洞内的气流与北卡罗来纳的海风不同,但足以比较出哪种机翼更优。这启示我们,世界模型不必完美复制整个宇宙,只需保留与决策相关的那部分结构。基于此,World Labs 的商业生态布局逐渐清晰:2025 年推出的 Marble 产品已能从文字、图片和视频生成可探索的三维世界,并通过 World API 向开发者开放;Atlas 则是支撑这些产品的底层模型。今年 2 月,该公司完成了 10 亿美元融资,投资方包括 NVIDIAAutodeskAMDFidelitySea。NVIDIA 关注 Physical AI,Autodesk 看重建筑与数字孪生应用,不同投资者对同一三维世界的需求各异,但都指向一个通用世界模型横跨多个软件产业的潜力。

当前行业对世界模型的定义仍存在显著分歧。Genie 3 专注于画面生成,MetaV-JEPA 2 不生成画面而是直接从视频中学习规律,NVIDIA 的 Cosmos 整合视觉推理、世界生成和动作预测,Runway 则从视频生成转向模拟。

这种分歧的核心在于数据来源与结构假设:一派认为三维结构可从视频数据中自然涌现,另一派则主张将相机位置、几何和物理约束直接嵌入模型。Atlas 选择了后者,将相机位姿和深度作为原生输入。

然而,这条路径面临训练数据稀缺的挑战。与大语言模型拥有海量文本语料不同,三维世界的空间关系和物理属性缺乏系统记录,且现实中的交互经验(如机器人插歪电线)难以无限复制,每次尝试都需人工复位。因此,机器人训练最缺的是'失败'经验,而模拟器允许其在低成本环境下快速积累数千次甚至数万次的试错数据。

李飞飞团队在计算机视觉领域的探索,从 2009 年的 ImageNet 到如今的 Atlas,展现了一条清晰的演进脉络。ImageNet 基于 WordNet 概念体系,整理了 1419 万张图片、21841 个 synset,其中 ILSVRC 竞赛仅使用了 1000 类,旨在让机器识别图像中的物体及其位置。十七年过去,识别问题已基本解决,模型不仅能认出杯子,还能生成从未存在过的杯子。当前的难点转向了物体在世界中的动态关系:杯子在屋内的位置、绕到桌子背后是否仍是同一只杯子、被推走后下一次观测时的状态。

这标志着从'认得出'到'知道如何存在'的转变。1940 年阿根廷作家阿道夫·比奥伊·卡萨雷斯的小说《莫雷尔的发明》中,主角在荒岛遇见由机器循环播放的一周生活投影,包括声音、形象甚至触觉气味。这台由潮汐驱动的机器保存了现实的全部感官证据,却因无法生成当时未发生的事件(如主角与投影中女人 Faustine 的互动)而显得局限。按 World Labs 的标准,莫雷尔的机器是一台完美的渲染器,而今天的挑战在于模拟那件从未被拍摄过的事:有人走进去,伸手,把桌上那只杯子碰倒。莫雷尔的岛上什么都有,只差这一下。

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅