具身智能的分水岭,在第一天
软硬结合没法后补:先看数据曲线,再看演示。
上一篇说,机器人的分水岭在产线。具身智能(Embodied AI)说的是让模型长出身体、能在真实世界里动手。它的分水岭还要往前挪一步——挪到一家公司成立的第一天。
先把看法说在前面:软硬结合这件事没法后补。大脑再强,手不够好、关节不够小,硬件撑不住高质量的采集,模型的能力就发挥不出来。为什么?因为具身的数据爬不到。它只能靠真机一次一次做出来,谁能把本体造出来并部署下去,谁就握着数据的水龙头。硬件决定模型能力的上限。
先看曲线,再看演示
那么,看一家具身公司该先看什么呢?看曲线,不看演示。
所谓那条曲线(scaling curve),就是数据量和能力之间的稳定关系:从几百小时的采集到几万小时,能力沿着一条线往上抬,投入才换得回能力。单点演示可以靠工程堆出来。但是堆出来的演示不外推,曲线才外推。画得出这条曲线,说明数据链路是通的;画不出来,说明每进一步都要从头再来一遍。所以我们看的是斜率。
非标的地方才有钥匙
再往下问一层:场景该怎么挑?挑标准不统一的地方。
标准化的活,专用设备早就干了。但是标准不统一的活,它一直干不了。作业对象越标准,传统自动化设备的成本就越低,智能也就没有溢价。真正需要具身智能的,是那些每家规格都不一样、换一个型号就得重新示教一遍的场景。分拣一个包裹:乱序、异形、软硬混装,还要翻个面找条码。这不是舞台动作,是生产力动作。选场景的第一问不是难度多高,是非标程度多高。钥匙只配非标的锁。
回到方向表上说。庚辛的核心关注是五个方向一条链,物理AI、具身智能与机器人是其中一条。这条线上我们比较看重闭环:大脑、本体、数据工具链,是不是长在同一副身体里。全栈不是野心大,是必要条件——不是什么都想做,是这件事必须一起做。先拿低难度的方案凑合演示、以后再补一只真正的手,补不上的。数据从第一天起就是两种东西。
也有反过来的说法:术业有专攻,大脑和本体分开做,各自更快。这一条成立,但是不唯一。分开做的前提是接口稳定;目前看,本体的形态还在变,接口每变一次,前面积累的数据就折一次价。折价多少?没人说得准。这一点行业里还没有定论。
我们陪着走全栈自研这条路的公司,从大脑、运控、数据一路做到灵巧手与人形本体。难,慢,贵。这是北坡。北坡没有班车。
(完整表述见档案馆「核心关注领域」。)
