「核心提示」 李飞飞们在搞的世界模型,大家都交了怎样的答卷? 作者 | 周可 编辑 | 王珊 2026年,世界模型是AI最热的战场之一。 四年前,ChatGPT掀起了生成式AI浪潮,让机器理解和生成语言的能力受到广泛关注。但当AI开始走向现实场景(比如具身智能、智驾),仅仅理解语言还不够,它还需要感知空间、理解环境变化,并预判行动的后果。 世界模型正是实现这类能力的重要技术路径 ,因此被业内视为下一阶段的“必争之地”,不同的探索也因此展开。 AI“教母”李飞飞离开斯坦福创办的World Labs,一年内估值升至约50亿美元,近期发布了新的世界模型Atlas;谷歌DeepMind的Genie 3,通过实验性产品Project Genie提供体验,可生成支持实时探索、持续交互数分钟的虚拟环境;英伟达则在今年6月,正式发布开放世界基础模型Cosmos 3。 在国内,9月10日高德发布世界模型ABot-Earth 0.7,作为全球首个3D原生城市世界模型,着重于还原并推演真实世界。 当AI走出屏幕、进入物理世界,它要如何应对真实时空里那些不可预设的变化与意外? 1、世界模型热起来,答案不止一种 世界模型、物理AI、空间智能,这些概念为什么突然火了起来? 因为大语言模型再强,也只是学会了表达,但它没有真正理解物理世界。举个简单例子,小孩在还不会说话时,就已经开始认识世界了,他们伸手抓住玩具,推倒积木,再俯身寻找。这些看似简单的动作,包含着对距离、方向、遮挡和物体运动的学习。 也就是说, 对世界的认识,并不完全依赖语言。 2025年11月,李飞飞在万字长文《从语言到世界:空间智能是AI的下一个前沿》中表示:空间智能在我们与物理世界互动的过程中至关重要,比如人们停车时判断间距、接住抛来的钥匙、在人群中避让。空间智能关乎的不只是识别图像,而是将感知、想象、推理与行动联系起来。 这是AI需要继续突破的地方,而 世界模型正是实现这一目标的核心路径 。 这一视角让世界模型的价值不再局限于构建逼真的场景,而是进一步指向创作、模拟与现实互动。越来越多的企业开始押注世界模型。 在此背后,空间智能与世界模型的关系也更清晰。空间智能是AI感知空间、理解环境变化并辅助行动的能力,世界模型则是实现这类能力的重要技术路径之一。 前者描述能力、目标,后者探索如何建立对环境及其变化的内部认知。 李飞飞在文章中对世界模型提出了三项要求:能够生成在几何、物理和动态层面保持一致的世界;能够处理图像、视频、深度、语言与动作等多模态信息;能够根据动作预测环境的下一状态。 不过, 如何实现这些目标,行业尚未形成统一答案。 World Labs在9月1日发布了新模型Atlas,尝试在统一模型中结合空间生成、真实场景重建与时空模拟。据官方介绍,它能根据少量照片生成新视角、输出三维几何,也能辅助构建机器人训练与测试所需的模拟环境。而谷歌DeepMind的Genie 3更强调实时交互,让环境随着用户的探索持续生成。 在众多玩家中,高德把重点放在真实世界的时空数据上,将物理世界本身重建出来。9月10日亮相的ABot-Earth 0.7,被高德定义为“3D原生城市世界模型”,着重于城市空间的三维表达与交互。 这依赖于高德多年的时空数据积累,过去一年,高德全面转向空间智能能力建设,此次发布的ABo-Earth 0.7,既是高德空间智能能力的重要体现,未来也将成为高德空间智能的重要核心引擎。 2、如何理解这个世界? 实际上,当前世界模型尚未收敛为单一的技术范式。 行业都在探索如何让AI认识环境、预测变化,但 对于模型应该学习什么、怎样表示世界,以及输出什么结果,仍有不同答案。 李飞飞和她的World Labs是从三维结构切入,强调生成、重建与模拟的结合。在她提出的框架中,模型不仅要形成对环境的内部认识,还应能够输出可观察的世界状态,并在交互中维持几何、物理与动态上的一致性。 长期担任Meta AI首席科学家的杨立昆,倡导的联合嵌入预测架构JEPA,则将重点放在抽象表征中的预测。它不要求模型还原未来画面的每一个像素,而是尝试学习环境中有用的结构与变化。例如,行动规划,物体的位置及运动趋势很重要,表面的纹理和光影细节却未必需要被逐一预测。 不同路线各有侧重,却指向同一个问题:该如何理解世界,模型对环境的认识,最终要服务于怎样的交互与行动?如果无法回答这个问题,世界模型就仍停留在技术推演层面,难以在真实场景中产生实际价值。 高德的思路, 是将“如何理解世界”放回到具体的出行任务中, 在构建世界模型前,先打磨出空间智能底座,这个底座由三层能力支撑。 第一层是动态感知,读懂路况、人流、天气和现场环境的实时变化。 地图上的道路和门店位置相对稳定,路上的车流、临时施工、目的地的人流却随时在变。同一个地址,工作