专家都在聊的世界模型,到底是什么?

伸手去推桌上的一只杯子,人会在脑中瞬间“预演”接下来的画面:杯子滑落、水洒出来、也许还会碎在地上。这种行动前的“内心彩排”和支撑它的“心智地图”,正是当下人工智能最稀缺的能力,也是世界模型(World Model)这一前沿方向最想为机器赋予的本领。

2026年,世界模型,这个学术源起可追溯至1943年的技术概念突然热门起来。从7月的2026世界人工智能大会、8月的2026世界机器人大会,到9月上旬的外滩大会,几乎所有头部人工智能与具身智能企业都在谈论世界模型。国内外学界专家也纷纷为它发声甚至下场创业。围绕世界模型的技术竞赛已然鸣枪。

然而,热词也伴随着混乱:做视频生成的、做三维重建的、做机器人仿真的,都自称在做世界模型。用斯坦福大学教授李飞飞的话:“世界模型已成为人工智能领域最重要、同时也最被滥用的术语之一。”

一个真正“通用”的世界模型,究竟什么样?

北京时间9月2日,李飞飞联合创办的空间智能创业企业World Labs发布了新一代世界模型Atlas, 用户输入场景的若干视角图像或文字描述,模型就能输出时空任意位置的画面。

按照李飞飞与团队在《世界模型的功能分类法》一文中的介绍,世界模型按功能可分为三类:渲染器输出供人观看的像素画面,模拟器输出符合客观规律的环境状态,规划器输出智能体的动作指令。三类模型底层并不割裂,几何、物理、动力学这套描述世界运行逻辑的基础知识,是三者共用的底层原理。

李飞飞认为,世界并非由文字构筑而成,世界模型是实现空间智能的必经之路。大语言模型让机器拥有了出众的概念理解、词汇运用与逻辑推理能力,但无论是现实物理世界还是虚拟世界,都依托另一套底层规律运行。语言模型学习文本的统计规律,世界模型则学习时空的统计规律:光线如何落在物体表面、不在相机拍摄视角下的花园是什么模样、物体受外力后如何运动并遵循物理定律。

虽然都对世界模型终局有大一统的判断,但与李飞飞不同,清华大学教授、生数科技创始人朱军给出的通用世界模型路线图是从能力演进方面进行定义。

在朱军看来,大语言模型让机器开始理解和使用人类语言,世界模型要解决的是更进一步的问题——机器如何理解世界本身。其关键,是建立一个可更新、可干预的世界状态:不仅要从观察中判断“世界此刻是什么样”,还要在动作进入后推演“世界会因此怎样改变”,并用真实反馈持续修正自身。“AI(人工智能)生成只是把世界‘显影’出来,而真正的世界智能,是在变化中持续保持对世界的正确判断。”朱军说。

“我们从一个最朴素的问题出发:人的大脑到底凭什么能理解世界?”朱军说,回想小时候学骑自行车的经历,在骑车这项技能内化之前,人动作僵硬、不断摔跤、不断修正。技能内化之后,大脑开始做一件事——预测。对每一个可能的动作,它都提前预判后果和随之而来的身体状态,再把这个预判“喂”回肌肉。“我们管这个叫熟练,而熟练很大程度上就是一个训练有素的内部世界模型。”

朱军说,一个孩子能学会倒水,靠的从来不是打翻了多少次水杯,而是看过太多次别人倒水的样子。人类从不需要亲历每一种失败才能理解世界如何运转:我们观察,我们在脑海里推演接下来会发生什么,然后再动手。理解、想象、行动,这三步构成了人类智能面对世界最古老、也最基本的世界模型闭环。

基于研究,朱军提出了通用世界模型五级演进路线图:L1世界生成、L2与世界交互、L3在世界中行动、L4自主世界智能体、L5多智能体协同的“世界编排者”。他强调,通用世界模型不只是生成器、模拟器或策略模型,而是“理解世界、想象未来、采取行动”三者紧密咬合的闭环反馈系统——行动会改变环境、产生新信息,再进入下一轮理解与决策。

以世界模型为核心的物理AI,已被业界视为“下一个必争之地”。“我无法想象,缺少预测自身行动后果的系统,我们如何能做得出真正的AI智能体。”2025年底,图灵奖得主杨立昆离开Meta公司,创立AMI Labs先进机器智能实验室,并筹集超过10亿美元用于构建世界模型系统。

赛道愈热,对现实差距的清醒认知愈显必要。北京智源人工智能研究院院长王仲远坦言,目前几种类型的世界模型,距离成为真正能理解、预测、交互真实物理世界的基座模型都还有较大差距,行业仍处于非常早期的阶段。

实现路径之争远未有定论,但一个共识已经达成:无论从哪条路出发,人工智能终归要走出文本,走进物理世界。

更多热点速报、权威资讯、深度分析尽在北京日报App

来源:北京日报客户端

(流程编辑:U073)

如遇作品内容、版权等问题,请在相关文章刊发之日起30日内与本网联系。版权侵权联系电话:010-85201664

扫描二维码
下载手机客户端

分享到
点击下载图片 长按保存图片