
大语言模型的红利期进入后半段,物理世界成了巨头们共同看中的下一个方向。资本入场比概念更早,仅今年一季度,全球物理AI领域的融资就超过64亿美元,资金明显向世界模型和基础模型集中。
让AI在“脑子里”预演物理世界、再到现实里执行,被视作通向机器人、自动驾驶和下一代计算的必经之路。这条路上最早也最响亮的布道者是李飞飞,她那句“宇宙并非由文字构成,而是由真实的事物构成”,几乎成了整个赛道的开场白。
这条路线刚起步,创办它的李飞飞就带着公司投靠了AMD。
AI的下一步,从预演世界开始
交易以约82亿美元的全股票方式进行,完成后,她将出任AMD执行副总裁兼首席科学家,直接向苏姿丰汇报。这家公司成立不过两年多,今年2月刚完成一轮10亿美元融资,投后估值约54亿美元,短短七个月后,AMD开出的价格又高出了五成多。
这是AMD史上第二大收购,仅次于2022年约500亿美元的赛灵思。但和赛灵思不同,World Labs没有成熟的产品线,也没有披露过收入数字。它的第一款商业产品Marble去年11月才正式上线,新一代模型Atlas更是在交易宣布前不到一个月才亮相。
交易宣布前不到一个月,英伟达刚刚签约以约129亿美元收购开源模型社区Hugging Face,两大芯片巨头在同一个月里,先后把手伸向了模型层。
2012年,一个叫AlexNet的神经网络在ImageNet图像识别竞赛中大幅领先,它是用英伟达GPU训练的。那场比赛被普遍视为深度学习时代的起点,也间接成就了英伟达此后十几年的AI霸业。而ImageNet的创造者,正是李飞飞。如今,她选择了AMD。
消息在美股收盘后传出,AMD官方数据显示,盘后股价仅微涨0.40%,随后三个交易日累计涨幅也不到2%。一家被寄予厚望的明星公司,一笔创下纪录的收购,资本市场的态度却相当平静,世界模型这条赛道,眼下还撑不起一个确定的估值。
然而,撑不起估值的一部分原因恰恰出在“世界模型”这四个字上。大语言模型擅长的是语言,它能把物理讲得头头是道,却未必真的“懂”我们所在的物理世界。而世界模型的核心想法,是让AI在“脑子里”先把世界预演一遍,再决定怎么行动。
世界模型和游戏引擎、物理引擎的区别也很直观:后者是工程师一行行“写”出来的规则,前者是AI从海量视频和传感器数据里“学”出来的规律。规则精确、可验证,但写不完现实世界的复杂。学出来的规律理论上可以泛化到没见过的场景,代价是不够精确,时不时会“幻觉”。
天气预报提供了一个现成的参照,传统的数值天气预报是把大气切成网格,一格一格地解流体力学方程。过去几年,谷歌DeepMind的GraphCast、华为的盘古气象等AI模型不再解方程,而是直接从几十年的气象数据里学习天气如何演变,在不少指标上已经能与传统方法比肩,速度还快得多。AI气象模型,本质上就是一个“只管天气”的世界模型。
世界模型公司想做的,是把这件事从天气推广到整个物理世界。
不一样的世界模型
李飞飞今年6月发文承认,计算机视觉、机器人、强化学习和生成式AI各自都说自己在做世界模型,但说的根本不是同一件事。这篇文章给出了一个分类,大致可以把市面上的世界模型分成三个层次。
渲染器根据条件生成逼真的画面或3D场景,本质上离视频生成和3D生成并不远。模拟器给定一个动作,预测世界会怎么变化,比如“机器人手往左移5厘米,杯子会不会倒”。规划器用内部对世界的理解,直接决定下一步该怎么做,这才是世界模型最初的学术含义。
落到具体玩家身上,腾讯混元的HY-World和World Labs的Marble主要停留在第一层,生成可以走进去、可以导出的3D世界。谷歌的Genie 3和昆仑万维的Matrix-Game往前多走了一些,画面会随着用户的操作实时变化,介于第一层和第二层之间。
以色列公司Decart则两头下注,Lucy实时改写视频画面,偏向渲染。Oasis面向机器人和自动驾驶,偏向模拟。英伟达的Cosmos是一整套产品线,从画面生成到物理推演都有覆盖,重心落在机器人和自动驾驶上。Waymo和Wayve的驾驶模型,则是第二层最典型的代表。杨立昆创办的AMI Labs直奔第三层,干脆不生成画面,只在抽象空间里学习“世界如何运转”。
不过,当前大多数商业化的“世界模型”,主要做的是第一层。昆仑万维的Matrix-Game团队曾把世界模型拆成三步,理解当前状态、预测下一状态、渲染呈现。
多数模型其实跳过了前两步,直接去做了渲染。昆仑万维董事长方汉倒是早在7月的世界人工智能大会上就宣布,2026年是“世界模型元年”。连AMI Labs的CEO勒布伦今年3月都对TechCrunch说过,“世界模型”会是下一个热词,六个月之内,每家公司都会自称世界模型公司去融资。市场常常在用第三层的愿景,给第一层的产品定价。
落地的用法有了,还都很朴素
说世界模型还停留在PPT阶段,并不公平。它已经有了真实的用户,只是用法比宣传中朴素得多。
今年2月,Waymo发布了基于谷歌Genie 3改造的Waymo World Model,能模拟龙卷风、被淹没的街道,甚至公路上出现一头大象这类车队从未真正遇到过的场景。英国自动驾驶公司Wayve 8月发布的GAIA-4,已经能把驾驶AI放进闭环:AI做出不同的决策,它“看到”的路况就随之改变。自动驾驶之所以先行一步,原因在于数据最丰富,需求最明确,而极端场景在现实中根本没法反复测试。
机器人领域则把它当成“数据工厂”。Agility Robotics、Figure AI、Skild AI等公司都是英伟达Cosmos的早期用户,用它批量生成真实世界难以采集的训练数据。内容创作端,Decart称已有超过10万名开发者基于其模型做产品,主要集中在电商和直播。腾讯开源的HY-World 2.0,直接瞄准游戏地图和关卡原型的制作。
“用不完美的数据训练机器人”,是外界最常见的质疑:模型自己都不太懂物理,拿它生成的数据去训练机器人,等于在教错东西。业内人士的看法恰恰相反,合成数据的价值从来不在于“真”,而在于便宜、多样、可控。飞行员在模拟器里反复练习发动机失效,模拟器的手感和真飞机并不完全一样,但这些情况在真飞机上根本不敢练。机器人也一样,它们最缺的,恰恰是现实中采集不到的数据。
这类做法已有实证,今年ICLR上的Ctrl-World研究显示,仅用世界模型生成的合成数据做后训练,机器人在陌生物体和新指令上的成功率就从38.7%提升到83.4%。企业对合成数据的用法也相当清醒,英伟达的Cosmos Transfer让传统仿真引擎负责保证物理和几何的准确,世界模型只负责把画面变得逼真多样。
大语言模型有整个互联网的文本可以学,世界模型面对的却是一块空白,世上没有一个现成的“物理互联网”,普通视频里没有力反馈、碰撞和物体交互的真实数据,而这些恰恰是机器人最需要的。
中科院院士周志华在今年7月的世界人工智能大会上点出了第二重麻烦:世界模型多步推演的误差不是线性累加,而是按平方级放大,推得越远,崩得越彻底。哈佛、MIT等机构联合发布的MemoBench测的正是这类基本功,“物体恒存”,东西离开视野再回来,还在不在原处。这对人类来说近乎常识,但据报道,十个主流世界模型在这项测试中集体不及格,满分1分,最高只拿到0.58分。
算力的账更难算,据业内估算,世界模型所需的GPU算力是同等规模大语言模型的数倍乃至数十倍,实时生成高清画面往往需要多卡并行。
商业闭环的难题排在最后,World Labs、Decart等头部公司都没有公开过营收数据,技术能跑通,不等于客户愿意持续买单。所以,今天的世界模型,更像是嵌在自动驾驶、机器人和内容生产流程里的一项能力,而不是一个能单独撑起一家公司的产品。这一点,也是理解AMD这笔收购的钥匙。
苏姿丰出手,李飞飞点头
World Labs这边,两年多累计融资约12亿美元,放在任何一个软件赛道都是天文数字,但放在前沿模型赛道,并不宽裕。世界模型要处理视频、多视角、三维几何和实时交互,训练和推理都比大语言模型更吃算力。
商业化同样现实,Marble是一款相当不错的工具,能把几张照片变成可以漫游、编辑、导出到Unreal和Unity的3D场景,用户主要是游戏、影视和VR团队。但它属于“渲染器”这一层,做的是一门工具生意。而李飞飞真正想做的“空间智能”,需要的是长期、不计短期回报的投入。
李飞飞在公告里说,推进下一代AI,“需要在模型研究、系统和计算之间紧密协作”。世界模型离不开算力,与其排队买卡,不如直接“加入”。她在官宣当天发布的公开信题为《去寻找一个更新的世界》,取自丁尼生长诗《尤利西斯》里那位拒绝靠岸、执意再度远航的老水手。
“随着公司的发展,我们的雄心也在不断扩大”,而雄心的扩大带来的是对算力需求的扩大,李飞飞说,“如果我们能够与AMD携手合作,就真的能为我们自己、AMD以及整个生态系统,创造一个加速软件和硬件开发之间飞轮效应的机会”。
在物理AI这件事上,AMD一直是追赶者。英伟达的Omniverse仿真平台和Isaac机器人工具链经营多年,2025年初推出的Cosmos世界模型如今也已迭代到第三代。反观AMD,此前公开发布的主要是文本和视频模型,自己在世界模型上只做过零星尝试,更多是以投资人的身份押注World Labs、Odyssey这样的公司。
AMD今年连着做了四笔收购:6月买下做内存优化的MEXT,7月收编端侧推理软件团队FastFlowLM,8月收购推理芯片公司Taalas,9月拿下World Labs。前三笔都是在推理效率和系统层面补课,World Labs是第一次押注一个连英伟达都还没完全占住的方向。
Taalas的做法是把AI模型直接“刻”进芯片,按它自己的说法,从拿到模型到做出芯片只需两个月左右。现在AMD手里又有了一个前沿模型团队,理论上具备了一种新的可能,不再只是让硬件去适配模型,而是由模型来定义硬件。只是世界模型几个月就迭代一代,而芯片一旦定型就难以更改,这条路能否走通,还要打一个问号。
AMD买的不只是“看清需求的能力”
不少分析认为,AMD花82亿美元,买的是提前几年看清AI算力需求的能力。芯片从定义到量产要三到五年,理解未来的工作负载当然重要。但如果只是想看清需求,合作就够了:双方从2025年起就在AMD GPU上联合优化模型训练和推理,李飞飞今年初还登上了AMD的CES舞台。
花82亿美元全资买下,AMD要的首先是排他性。英伟达同样是World Labs的投资人,收购之后,这支团队只属于AMD。其次是补齐对标英伟达Cosmos的拼图。更长远看,是要拿到定义需求的话语权。
苏姿丰在采访中说:“你对整个端到端流程了解得越深入,就越能打造出更好的系统。这就是我们收购World Labs的原因”。谈到目标,她直言:“你将同时拥有开源模型和专有模型”,而AMD的雄心,是“定义AI计算的未来”。
当年英伟达的护城河不是预测出来的,而是在AlexNet、CUDA和一代代研究者手里“养”出来的。AMD想复制的,正是这个过程:让下一代AI负载,从一开始就生长在自己的芯片和软件上。
这笔交易全部用股票支付,是后来者以小博大的打法,也让AMD的扩张高度依赖自身股价。
收购完成后,世界模型赛道的主要力量,几乎都和一家算力巨头绑在了一起。英伟达自研Cosmos,同时投资了World Labs、AMI Labs、Decart和Odyssey等一众初创公司。谷歌有Genie,并已在Waymo落地。亚马逊则用自研的Trainium芯片,把Decart和Odyssey签成了AWS的客户。
现在,AMD拥有了World Labs。
仍然独立的头部公司,如AMI、Decart、Odyssey和General Intuition,大多也已经通过融资或合作,和某个算力阵营产生了关联。“中立”的世界模型公司,正在变成稀缺品。
对研究本身,这笔交易或许会带来一些变化,苏姿丰和李飞飞在交易当天的联合受访中都表示,AI仍处在非常早期阶段,未来的竞争在于软件与硬件的协同进化。模型与芯片的协同设计会加速,世界模型的计算特征与大语言模型差异很大,它要同时处理大规模视频、多视角空间信息、三维几何和低延迟交互,当世界模型团队第一次能直接参与定义芯片,算力这道坎有可能从硬件端得到缓解。
3D路线也拿到了“长期饭票”,李飞飞在公开信中承诺,要在AMD内部建立一个可持续数十年的前沿研究组织,并坚持提供广泛可访问的开放模型,不必再按融资周期赶进度,World Labs可以做更长线的研究。
不过这笔交易并没有给路线之争下结论,世界模型的技术路线至今没有收束,也没有跑通。收购证明的是World Labs的团队和品牌值钱,而不是3D路线就是终局。(本文首发钛媒体APP,作者 | 硅谷Tech-news,编辑 | 郝敬钰)

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App