这边宇树上市仅一个月,市值便从超4400亿的高点滑落至2000亿左右。与此同时,大洋彼岸被称作“美国宇树”的机器人却展现出近乎“成精”的能力。
9月17日, Figure AI发布了新模型Helix 2.5,将机器人送入30个陌生家庭,执行铺床、叠毛巾、收拾玩具等家务。
这些任务并非它首次尝试。今年3月,Figure的机器人已能自主打扫客厅;5月,它在桑尼韦尔总部进行了约200小时的直播,3台机器人轮班作业,分拣了24.9万件快递。
此次的独特之处在于,Figure的机器人展示了 “换地方也能干” 的能力。
做过家务的人,不会因为换到别人家,就从头学习铺床或叠衣服。但机器人换个环境,通常需要重新演示、采集数据并训练,才能适应新场所。
甚至仅仅是家具摆放或物品尺寸不同,之前学会的动作就可能失效。
这次,Figure AI将机器人直接投放到30个从未去过的真实家庭,未提前采集数据或逐一重新训练,就让机器人直接上手做家务,并宣称实现了“零样本泛化”, 通俗地说就是“机器人到了新环境,无需重新学习就能干活”。
难道,机器人保姆即将上岗?
机器人终于学会举一反三?
不过,细看成绩单,仅从数据看,这次的“泛化”并未神奇到极致。
Figure共进行了420次测试,Helix 2.5成功完成237次,整体成功率为56%。细分来看,铺床成功率为67%,叠毛巾为62%,收拾玩具仅为40%。
这意味着它每干两次活,差不多会失手一次。尤其是最后一项,十次中有六次无法收拾好,距离真正能接管家务的机器保姆还很遥远。
但56%这个数字,在人形机器人做家务的泛化测试中已属顶尖。据Figure描述,这是人形机器人首次在如此多的真实家庭中,展示这种规模的零样本全身泛化。
官方还发布了一段3小时57分钟的完整视频。在这段视频中, Helix 2.5确实展现出了非常“有人味儿”的动作。
例如,铺床时,机器人发现站位不合适,会主动后退调整姿势;被子没铺好,它会绕到床另一侧,换个位置继续整理。以前的机器人经常在动作出错后不知所措,甚至为不出乱子而直接罢工。
如今,Helix 2.5最令人惊喜的是能在干活过程中发现问题时,立即想办法补救。
此时再回头看今年5月那场200小时直播,两代机器人的差异显而易见。
当时的Helix 02能守在工作台前连续干活,但这些技能依赖于现场采集的数据。一旦工位更换,周围设备和物品改变,即使任务相同,机器人仍需重新采集数据和训练。
最终,那场直播测试虽证明了Helix 02是能持续工作的好手,却未能证明它真的具备泛化能力,能随环境变化灵活运用技能。
而这次,Helix 2.5换了整整30个地方。
每个家庭的床、家具和物品都不同,它仍能完成一半以上的任务。
|那么,在短时间内,Helix 2.5为何能进步如此之大?
Figure进行了一组对照实验,两边使用相同的任务数据,模型架构、训练方法和测试条件完全一致,唯一区别是一个模型提前观看了人类干活的视频。
结果,没看过视频的模型成功率仅为9%,看过的直接升至56%。
这套视频中到底有什么,能让机器人在陌生环境中的表现大幅提升?
秘密在于Index。
先培训,再上岗
Index这个名字听起来像复杂技术,但真相可能很简单。继续通俗解释, 就是Figure花钱请人干活,并拍摄全过程,用来教机器人。
有人在家铺床、叠衣服、打扫卫生,有人在餐厅收拾桌子,在商店补货,甚至还有人录制了铲猫砂和换机油的过程。普通人只需下载Index应用,上传自己做事的视频,审核通过后就能获得报酬。
短短四个月,Index在108个国家积累了超过1600万条视频,每周还有4.4万人持续上传。Figure为此已支付1500万美元。
不过,并非随便拍一条扫地视频就能拿钱。这些上传并审核通过的视频都有一个前提:不重复。
Figure会对上传内容进行筛选、去重,并检查是否有作弊和大量重复。据公司数据,每1000小时的Index视频,涉及约373种任务、1146种物品和116种环境。
最终在Index上,同样是铺床,有人从床头开始,有人先抖开被子;同样是整理房间,每家摆放的家具和需要收拾的物品也不同。同一类任务有五花八门的解法,主打“贵在真实”。
这些同一任务的不同变化,都是自然产生的,再厉害的工程师也无法在实验室里一条条模拟和设计出来。
于是,Figure的机器人在真正练习之前,已通过观看大量人类与现实世界打交道的真实视频,先培训再上岗。
有了这些视频打底,Figure可以先将训练顺序整个调转过来。
过去,机器人通常先确定要学什么,再围绕任务收集数据:教叠毛巾,就安排机器人反复叠毛巾。
现在Helix 2.5反其道而行之,先在Index里预训练,见过足够多的人、物品和环境,再去学铺床、叠毛巾和收拾玩具。
这套思路与大模型的预训练如出一辙:先海量“见世面”,再专门学手艺。
前面的对照实验已证明,这一步确实有效。同样一批家务训练数据,交给一个看过大量人类示范的模型,到了陌生家庭,表现截然不同。
这也解释了Helix 2.5为何能在30个家庭中临场调整。只要此前见过的动作和场景足够多,遇到床铺尺寸变化、站位不合适或物品没放好时,它的“大脑”中便多了几种可尝试的方法。
不过,既然1600多万条视频已让Helix 2.5学会了一些举一反三,那么再多一倍、两倍甚至十倍的数据,它还会继续变聪明吗?
机器人训练变天了?
实际上,喂的数据越多,大模型效果越好,这在AI大模型领域早已是金科玉律,即Scaling Law。
因此,各大模型公司都在抢购更多算力、收集更多语料,并将模型规模越做越大。因为按Scaling Law,只要数据和算力持续增加,模型通常会按一定规律变强。
这次Figure给机器人喂了2倍、4倍甚至8倍的Index数据,从操作上看,也像是在机器人身上复刻大模型的Scaling Law。
那么,机器人领域也有Scaling Law吗?
还真让Figure测出来了。
研究人员共训练了四组模型,最大一组使用的Index数据是最小一组的8倍。模型大小、后续家务训练及其他条件全部一致,只改变预训练时给机器人看过多少人类视频,然后只盯一个指标:机器人预测下一步动作的误差。
结果,Figure发现:随着Index数据增加,机器人的动作预测误差确实在持续下降。 且这条下降曲线很规整,数据每增加一档,误差减少多少已能提前估算。
Figure还利用前三个模型的数据拟合出这条曲线,在最大那次训练开始前,直接算出了其误差。等训练完成后一看,实际结果与预测精确到小数点后四位。
这样看来,机器人似乎真有自己的Scaling Law。Figure还给这条曲线起了名字: “人类到人形机器人的迁移Scaling Law”:
这条曲线,解决的是机器人行业的一个长期难题: 过去想让机器人更强,只能采集更多机器人数据,既昂贵又缓慢。
但如果人类干活的视频能按可预测的规律转化为机器人的能力,那么投入多少、产出多少,就能照这条曲线提前计算出来,花费多少也心中有数。
Figure愿意继续收集数据、购买算力,赌的就是这条曲线成立。
9月3日,Figure宣布与AI云计算公司Nscale合作,计划从2027年下半年开始部署英伟达Vera Rubin平台,最终最多使用10万块GPU。最初承诺的算力投入达35亿美元,未来意向是扩大到60亿美元以上。
35亿美元买算力,这更像是大模型公司的做法。而且Nscale不仅出售算力,还战略入股了Figure,成为其股东。 黄仁勋在官宣中表示,这次合作“激活了机器人飞轮”。
另一边,Index每秒钟仍在收到约35分钟的人类行为视频。
一边是全世界的人不断拍摄自己如何干活,另一边是最多10万块GPU等着将这些视频喂给机器人。Figure作为一家机器人公司,却走在一条越来越像大模型公司的路上。
不过,目前这条被称为“人类到人形机器人的迁移Scaling Law”的曲线,还存在不少问题。它仅有四个点,跨度只有8倍,难以支撑一条定律。
例如,实验测量的是动作预测的误差,而非任务成功率。误差下降,并不代表喂的数据越多,家务就干得越好。
而且56%的成绩是Figure自己评定的,30个家庭全是湾区租来的房子,三项任务也是提前选定的。
尽管Figure在这次家务测试中迈出了重要一步,但距离大家请到一位机器保姆,还有很远的距离。
参考资料: APPSO《刚刚,机器人首次「空手闯进」 30个陌生家庭,进门就干活》 极客公园《Figure AI宣称找到了机器人版scaling law,同行却说它其实根本不会泛化》 本文来自微信公众号“蓝字计划”,作者:Chester,36氪经授权发布。
John Martin 回复 2014年1月15日
九游首页以九游首页为核心,带来高效便捷的体验。
John Martin 回复 2014年1月15日
想了解更多九游官网网址相关内容,尽在九游首页。
John Martin 回复 2014年1月15日
九游首页围绕九游网址不断创新,回应用户的真实需求。
John Martin 回复 2014年1月15日
精选九游体育网址内容,九游首页与你一同发现更多精彩。
John Martin 回复 2014年1月15日
九游首页专注每篇内容均围绕操作细节与常见问题展开,适合零基础读者逐步入门。,为用户提供专业可靠的体验。
John Martin 回复 2014年1月15日
围绕持续更新新作观察与资源管理解析,紧跟行业动态。,九游首页持续打磨更优质的服务。