跳至正文
AI 观察 · 3 分钟

为什么大模型越来越聪明,人形机器人还是这么蠢?

现在的大模型可以制作完整的程序,但是好多机器人连跑个步都摔的七零八落的。

现在的大模型可以制作完整的程序,但是好多机器人连跑个步都摔的七零八落的。

那为什么大模型可以搞定我们人类都觉得棘手的事情,人形机器人却连人最简单的运动都做不好。

要搞懂这事,我们得从他们的训练方式来讲。

大模型他面对的是数字世界,他可以无限复制数据,反复训练。

而具身机器人面对的是物理世界,他面临数据稀缺、环境多变等问题。

而且呢,大模型他换个模型大多数情况下数据仍然适用,而人形机器人呢,不说换个胳膊吧,哪怕就是换个手指。

有些数据都得重新训练了,你说麻不麻烦。

而且二者还有很大的一点区别,那就是试错成本,你想想看,大模型犯错了会怎么样?

无非就是让他重新思考,告诉他什么对呗。

但要是机器人犯错了呢?

比如他跑个步,犯小错的话还好,最多摔一跤,最差的结果也就是机器人报废。

那如果犯大错了呢?

直接冲出去给墙壁都给砸个窟窿出来,那万一旁边还有人,这事就不敢想了。

你看看,两种模型,都是犯错,一个呢没啥大事,而另一个呢,轻则损坏物品,重则伤人,训练成本天差地别。

还有,当我们点开大模型的推理过程,你会发现,他们也偶尔犯错,尤其是写代码的时候,但是大模型会自我纠错,所以最后输出的时候大多情况没有问题。

而人形机器人呢,他当然也可以纠错,但是呢,我们现实世界,有些错误是无法补救的,而这也导致机器人只要中间一步犯错,后面的任务都可能受到影响。

训练成本的差距就会导致二者的训练数据量天差地别,大模型动辄几万亿Token的数据量,几天就能刷完人类几千年留下的知识;而具身机器人为了学会叠一件衣服或拧开一个瓶盖,往往需要工程师戴着动捕设备或VR眼镜遥操作上千次,甚至跑报废好几台样机,整整几个月才攒下几万条勉强可用数据,数据规模完全不在一个数量级上。

不过我认为,机器人真正缺的,可能还不只是数据。

大模型为什么能吃遍全世界的数据?

因为不管中文、英文还是代码,最后都可以被转化成统一的Token。

可机器人到现在,还没有属于自己的“Token”。

不同机器人的身体参数都不一样。

同样是“拿起一个杯子”,放在不同机器人身上,对应的电机信号和动作轨迹可能完全不同。

一家公司辛辛苦苦训练机器人抓了一万次杯子,换一只手,很多数据可能就用不上了。

所以机器人行业所拥有的数据,实际上更像拥有无数座互不相通的孤岛。

每家公司都在教自己的机器人,从头学习同一套动作,所有人都在重复交学费。

因此我觉得,人形机器人快速发展真正的临界点,是行业终于发明出一种属于机器人的“普通话”:无论换什么身体、什么手臂,一台机器人学会的动作,都能直接教给其他机器人。

另外其实这种“普通话”,今年已经有了更像样的雏形。

像小鹏机器人和清华等团队推出的UniT,把人的动作和人形机器人的动作压进同一套“物理Token”,已经在IRON真机上验证了抓取和倒水;自变量机器人联合清华大学、香港城市大学推出X-Tokenizer,把17类机械臂的动作压缩成一套可以共同使用的动作Token。

不过这些方案现在还是各说各的“方言”,只在有限的机器人和任务上得到了验证,距离换一副身体就能直接用还很远。

相信未来,一台机器人摔过的跤,其他所有机器人,都不用再摔第二遍。

继续阅读人死后,大脑切片竟然还能“学会”弹钢琴