现在的大模型可以制作完整的程序,但是好多机器人连跑个步都摔的七零八落的。
那为什么大模型可以搞定我们人类都觉得棘手的事情,人形机器人却连人最简单的运动都做不好。
要搞懂这事,我们得从他们的训练方式来讲。
大模型他面对的是数字世界,他可以无限复制数据,反复训练。
而具身机器人面对的是物理世界,他面临数据稀缺、环境多变等问题。
而且呢,大模型他换个模型大多数情况下数据仍然适用,而人形机器人呢,不说换个胳膊吧,哪怕就是换个手指。
有些数据都得重新训练了,你说麻不麻烦。
而且二者还有很大的一点区别,那就是试错成本,你想想看,大模型犯错了会怎么样?
无非就是让他重新思考,告诉他什么对呗。
但要是机器人犯错了呢?
比如他跑个步,犯小错的话还好,最多摔一跤,最差的结果也就是机器人报废。
那如果犯大错了呢?
直接冲出去给墙壁都给砸个窟窿出来,那万一旁边还有人,这事就不敢想了。
你看看,两种模型,都是犯错,一个呢没啥大事,而另一个呢,轻则损坏物品,重则伤人,训练成本天差地别。
还有,当我们点开大模型的推理过程,你会发现,他们也偶尔犯错,尤其是写代码的时候,但是大模型会自我纠错,所以最后输出的时候大多情况没有问题。
而人形机器人呢,他当然也可以纠错,但是呢,我们现实世界,有些错误是无法补救的,而这也导致机器人只要中间一步犯错,后面的任务都可能受到影响。
训练成本的差距就会导致二者的训练数据量天差地别,大模型动辄几万亿Token的数据量,几天就能刷完人类几千年留下的知识;而具身机器人为了学会叠一件衣服或拧开一个瓶盖,往往需要工程师戴着动捕设备或VR眼镜遥操作上千次,甚至跑报废好几台样机,整整几个月才攒下几万条勉强可用数据,数据规模完全不在一个数量级上。
不过我认为,机器人真正缺的,可能还不只是数据。
大模型为什么能吃遍全世界的数据?
因为不管中文、英文还是代码,最后都可以被转化成统一的Token。
可机器人到现在,还没有属于自己的“Token”。
不同机器人的身体参数都不一样。
同样是“拿起一个杯子”,放在不同机器人身上,对应的电机信号和动作轨迹可能完全不同。
一家公司辛辛苦苦训练机器人抓了一万次杯子,换一只手,很多数据可能就用不上了。
所以机器人行业所拥有的数据,实际上更像拥有无数座互不相通的孤岛。
每家公司都在教自己的机器人,从头学习同一套动作,所有人都在重复交学费。
因此我觉得,人形机器人快速发展真正的临界点,是行业终于发明出一种属于机器人的“普通话”:无论换什么身体、什么手臂,一台机器人学会的动作,都能直接教给其他机器人。
另外其实这种“普通话”,今年已经有了更像样的雏形。
像小鹏机器人和清华等团队推出的UniT,把人的动作和人形机器人的动作压进同一套“物理Token”,已经在IRON真机上验证了抓取和倒水;自变量机器人联合清华大学、香港城市大学推出X-Tokenizer,把17类机械臂的动作压缩成一套可以共同使用的动作Token。
不过这些方案现在还是各说各的“方言”,只在有限的机器人和任务上得到了验证,距离换一副身体就能直接用还很远。
相信未来,一台机器人摔过的跤,其他所有机器人,都不用再摔第二遍。