一个西瓜正在快速掉落,下一秒,时间好像被按下暂停,你可以自由移动上前凑近看清细节,或是丝滑环绕到任意角度,西瓜摔成了多少瓣,你都能数得清清楚楚。
这可不是什么魔法,而是李飞飞团队 World Labs 刚刚发布的全球首个多模态世界模型 Atlas。
你给 Atlas 一张图片,它就能根据这张图片,重建出一个完整的 3D 世界。
Atlas 不仅能认出这是一个西瓜,还能精确模拟出它摔成几瓣、果汁怎么飞溅、碎块怎么弹开,甚至你可以像看电影一样,把视角拉到西瓜跟前,360° 无死角围观它"炸裂"的全过程。
但是,如果你觉得这只是一个3D AI 视频生成工具,那你就完全低估了李飞飞真正想干的事。
她讲过这样一句话,AI 的下一阶段,绝对不会是一个更大的语言模型,因为一个刚出生的婴儿,就可能比现在最强的 AI 更懂这个世界。
而这种能力,就是空间智能,简单点说,就是我们理解和互动于这个物理世界的基本能力。
你半夜起来想开个灯,不用多想,摸黑下意识也能摸到开关。
朋友把一串钥匙丢给你,你不用去心算什么抛物线方程,手一伸,就能稳稳接住。
这些对于人类来说很简单,但是对于 AI 来讲,就是一个压根不可能完成的任务,现在的 AI 这方面都是一片空白。
AI 要往前走,就必须从语言模型转向世界模型,Atlas 就是李飞飞给这个转型交出的答案。
一旦 Atlas 这样的世界模型大获成功,一旦 AI 真正有了空间智能,我们现在这个世界,会发生什么呢?
接下来,我会给你彻底讲清楚,里面的每一个事情,都足够让你受益无穷。
第一个,我们的创造力会大爆发。
以前你想建一座3D城市,你得学复杂的建模软件;现在,哪怕你只是一个还在上学的初中生,只要嘴巴一动,就能让脑海里的赛博朋克城市在虚拟世界里拔地而起。
在这个世界里,谁都可以是造物主。
第二个,机器人真的能理解世界了。
它不再只有笨手笨脚的机械臂,它会在模拟好的虚拟世界里学会成千上万种技能,然后直接走进家庭、走进工厂,成为真正靠得住的帮手。
第三个,也是我最关心的一点,科学研究和教育的进步速度,将被彻底颠覆。
学生想学历史书知识点,不用死记硬背了,直接穿越去和秦始皇面对面聊天;医生可以开启透视视角,借助 AI 更快地发现病灶;科学家更是可以在虚拟世界里,把黑洞边缘和马里亚纳海沟当成自家的后花园逛。
到那时候,人类探索世界的边界,将不再取决于我们走了多远,而是取决于我们敢想多大。
李飞飞总结过一句话,她说AI 的终极目标从来都不是取代人,而是为人类赋能。
我真是太认可了。
现在的大语言模型可能只是一个开始,真正的智能是机器可以理解我们的物理世界,帮助我们改造世界。