
人人都能成为机器人训练大师。
文|刘俊宏
编|王一粟
普通人也能在具身智能行业赚钱了?
42岁的李国英是一名网约车运营人员。前不久,她第一次戴上一台叫MEgo的头戴设备,记录自己浇花、擦玻璃、整理桌面和文件的过程。大约15分钟后,她把数据上传到觅蜂派App,通过审核,拿到了一笔任务收益。
李国英干的这件事,现在有一个新的叫法:机器人训练师。
9月23日,觅蜂科技董事长兼CEO姚卯青正式发布“觅蜂派”,包含“自研MEgo数采设备、觅蜂派App和数据治理引擎MEgo Engine”三个组成部分,定位为全球首个全品类高质量物理AI数据众包服务平台。
简单来说,这套平台运作模式类似外卖平台的“众包生意”:用户可以接取机器人训练所需的数据任务,采集数据换钱。觅蜂在收到这些数据之后,会治理、分级操作后,再打包用于机器人训练。
据了解,觅蜂派已经覆盖支持具身智能训练的22大类场景、5000多个任务和50000多个真实环境。在平台内测期的大约一个月时间,觅蜂派注册用户数达2万人,累计产生1.3万份采集任务提交。这意味着,觅蜂已经先把“数据”这台发动机点火了,直指当下具身智能行业数据资源稀缺的痛点。
针对这一数据采集模式,业界有人把觅蜂派称为“中国版Index”。但这个称呼只说对了一半。
今年8月,Figure发布Index,向全球用户付费征集真实任务视频,用来训练自己的模型。跟觅蜂相同的是,两边都把众包引进了具身数采。但区别在于开放程度,Index围着Figure自己的训练闭环转;觅蜂派面向不同模型厂商、机器人企业和数据采购方,按客户需求组织生产,再把处理后的数据作为服务交出去。
所以觅蜂派的意义,不是多了一个数采平台,而是物理AI数据的生产方式发生了变化——从集中采集,走向社会化协作。
这一改变,或许将很大程度改变具身智能行业的发展模式。
对于机器人公司来说,当下行业融资向头部集中,比起Demo,客户和投资人都更想看到真实营收。
但当下具身智能行业距离通用机器人或完整“大脑”还有不小差距,而觅蜂派采集的数据和数据工具本身都是立刻能成交的资产。这意味着公司可以在技术研发过程中,不断优化现金流,完成具身智能领域的“长跑”。
从行业侧来说,觅蜂派要把数据采集这一环从场馆里的采集厂,变成一张可对外交付的社会化供给网络。这意味着,机器人训练的数据来源将更多来自现实生活,而不是某种“设计好的场景”。
“物理AI最好的老师,是每一个认真生活的人。”
正如姚卯青的总结。觅蜂派所代表的数据采集模式,给具身智能行业和普通人带来的都是一次生产方式的变化。
但也有两个问题随之而来:众包来的数据,凭什么能训练机器人?这台数据“发动机”要达到最大功率,又要过哪些行业门槛?
会玩手机就能采集数据?
训练机器人做事,实际操作比想象困难太多。抓一个杯子,人看一眼就会,但机器人要看成百上千次示范。
过去行业的主流做法是真机遥操:人通过手柄、VR设备操纵机器人做示范。这一方式最为直接了当,因为过程中产生的数据和本体本身就是对齐的,训练价值较高。但问题是,这套方案又贵又慢——机器人数量、操作人员和场地,每一项都是成本。
解决方式,就是采集机器人数据,不一定需要非得有一台机器人在场。
近几年,具身智能开始转向无本体采集:不绑定特定机器人,先记录人的真实操作,再经轨迹重建和动作转换,适配不同模型和本体。简单说,就是先记人怎么做,再教机器人怎么做。
如今,无本体路线正在变得越来越重要。相比真机遥操“专项训练”的方式,无本体采集的数据更适合用于机器人模型预训练和零样本泛化。
觅蜂派押注的就是这一层。为了让普通人采的数据真能训练机器人,觅蜂搭了“硬件+App+数据引擎”三层体系,让用户拿回家就能“采得到、接得到、用得上”。
这套体系跟机器人公司自己用的有什么不同?
先看硬件,觅蜂自研的MEgo系列无本体采集终端,包括MEgo View和MEgo Gripper两个部分。MEgo View主要面向数据采集的Ego路线,是一套头戴式全景相机+腕部特写相机的组合。使用时,头部视角为机器人提供“人眼视角”,同时看到外部环境和理解人类手部的动作姿态,腕部视角能补充操作细节。

光锥智能体验了一下这套设备。整体感觉下来头戴部分还是稍微有些分量的,站着可能没啥感觉,但弯腰时间长了还是会有压力。不过,这款产品最好的部分在于操作简单,扣在头上就能用,可以说是完全没有用户学习成本了。
MEgo Gripper是UMI路线的采集设备。UMI路线跟Ego路线最大的不同,在于机器人与物理世界的交互方式不同。Ego路线适合灵巧手,UMI路线则是夹爪。MEgo Gripper整机重量不到一斤,操作起来比较顺手。
值得注意的是,MEgo Gripper上面原生自带显示屏,这是一个非常关键的设计。
当下行业普遍讨论数采设备时,大多聊的都是精度、自由度、重量,这代表的是采集数据准确性的问题。但光是数据准还不够,数采还需要定位、存储数据、上传等一系列配套操作。有屏幕、能交互,就能解决很多麻烦。不然采集者只能等到数据上传之后,才能知道画面是“歪”的,得调试设备。
两种硬件设备,显示出觅蜂对数采设备的理解偏向于消费级硬件。
只有把硬件做到好用、方便用,设备才能跟着人进家庭、门店和产线,而不是绑在实验室的机器人上。出货量作为佐证,8月31日,觅蜂宣布第20000套MEgo下线,累计已生产超过100万小时真实世界无本体数据。这套硬件,早已不是演示机。
光是硬件好用还不够,还得软件使用难度低。不然,过高的学习成本会“劝退”用户。
这一层靠觅蜂派App实现,光锥智能体验下来,感觉这套平台基本能实现普通人零门槛跑完整个流程。在用户侧,主要是四个环节:接单、采集、验收、结算。任务是认领制,需要“抢单”。领到任务之后,任务页会写清操作步骤、设备要求、验收标准和收益规则。

整个使用流程,用户不需要懂编程,也不需要懂机器人。“只要会玩手机,就会用这套App做任务”,一位数据采集者在第一次尝试完整任务之后告诉光锥智能。
众包数据如何训练机器人?
会用硬件和App,用户侧的事情就算是做完了。接下来数据能不能用,就需要觅蜂来处理。
姚卯青把众包数据进入模型的过程概括为四个字:采、懂、译、用。
其中,“采”是MEgo记录下第一视角视频、手部位姿以及触觉、力觉等信息。这一步并不困难,基本上是如实记录传感器输入的信号就可以了。
但“懂”和“译”相对来说就比较困难。
“懂”是MEgo Engine对长程任务进行理解和切分。例如一个“收拾房间”的任务,要被拆成抓、拿、放、拧、按等120多种标准原子动作。
译,是通过高精度位姿重建与动作映射,把不同人的手、身体、头部、机器人末端和环境信息,转化成统一的空间数据。这是人的经验能被不同机器人“看懂”的前提。
这两步的难点,在于数据采集设备不是“开天眼”,不可能永远看清交互的每个细节,高速移动、遮挡、多物体交互、光影变化,这些才是真实世界的常态。

最后一步是“用”,处理和分级后的数据进入具身模型训练,再经真机作业验证、回流、迭代。至此,采集、重建、质检、训练、部署、回流,整套训练数据闭环得以打通。
从整个流程看到,要想数据顺利进入训练流程,最关键的就是把这些参差不齐的众包数据变成能直接用于训练的数据。
这一步,觅蜂引入了数据质检体系。数据进入模型前要经过ManiEval多维度质检,从数据格式与时序、任务完整性、传感器质量、语义准确性和动作可学习性等方面评估,给来源不同的众包数据建立统一“体检”标准,再按质量和使用价值分级。
这套体系会把明显不可用的数据在结算阶段就自动化切掉,例如手部不在画面、设备戴歪、长时间静止等。其余数据贴上质量标签分级保留,匹配不同模型类型和训练阶段。一句话总结,就是没有废数据,只有放错地方的数据。
有趣的是,这种模式存在一个跟此前行业不同,但现实符合直觉的判断。
同样是“具身领域”,对于数据能不能用这件事上,自动驾驶对数据的要求非常清晰。这是因为驾驶场景具有高度确定性,达到评判标准很多都存在“唯一解”,所以自动驾驶行业会只留下“好司机”的驾驶数据。
但机器人在物理世界执行任务就不太一样,因为同样一件任务往往有不同路径,而参差本身就是一种行为分布。毕竟对采集者来说,采数据是日常工作之外的顺手记录,总不能要求他们为了采数据,以0.5倍速做本职工作。
当下数采领域一些第一视角采集通常要求参与者放慢动作、保持手部持续可见。这样做的结果确实是数据容易处理,但真实世界的行为分布也被收窄了。容易处理,不等于训练价值更高。
这条路能不能走通,外部已有一次可对照的验证:Figure用自家Index的数据做预训练后,在30套陌生住宅里,零样本成功率从9%提到56%,提升还是比较明显的。
那数据处理这么复杂,会不会耗时很长?
结算环节,平台要的是尽快给结果。姚卯青说,不希望采集完过很多天、甚至一两周才能看到反馈,所以会争取在一天之内完成有效时长提取和费用结算。对于数据的利用率,姚卯青估计说:“可能过了结算环节之后,超过95%的比例还是能最终被用起来的”。
总体结合数据处理跟数据采集看到,觅蜂体系对标的是整个具身智能行业的共性需求。
“行业这个现在还不能说完全收敛,但是大家还是会有共性需求”,姚卯青说,“比如场景要真实,场景要丰富”、“需要比较高的空间精度”、“以自动化方式为主的形式进行语义动作层面的描述性标签”。
由此看来,觅蜂的众包模式能成立,是因为采集和治理已标准化到可以结算、可以交付的阶段。
它并不意味着数据荒会很快结束,但它证明了一种新的生产方式正在诞生。
具身智能数据发动机开始点火?
无论是从今年WAIC、WRC还是光锥智能私下跟行业交流,总能听到具身智能行业对数据匮乏的抱怨。
缺少数据,是因为没人做数采吗?并不是,事实上数据和需求在同步膨胀。
姚卯青在群访中谈到需求的变化:去年上半年,很多还在一万小时规模;到去年年底,有人到了20万小时;今年很快已经“好多人说100万小时”,“实际我们接触到的用户都是千万小时的需求在提”。
百万小时不够用,不完全是总量问题,而是结构问题。
姚卯青举了个例子说,“叠衣服数据已经泛滥了,不需要了”。真正要补的是修水管、修车、理发、美甲这类专业技能,得一个个点亮。
但这些场景,能通过建立数据采集中心的方式获取吗?显然不太可能。
比如做宠物护理场景,数据中心不太可能真弄来猫狗。简单来说,就是场馆式采集线性扩产数据,解决不了具身智能训练的需求,也覆盖不了足够长尾的真实场景。

但对于数据的需求是真的,买家也已经就位,行业客观需要新的数据生产方式。
姚卯青把客户分成三类:有本体也有算法、要做基座模型的具身公司;不做本体、用无本体数据做预训练的世界模型公司;以及互联网语料消耗殆尽、要进入物理世界做闭环决策的大模型厂商。目前,觅蜂已开始服务腾讯Robotics X实验室、蚂蚁灵波等头部具身智能客户。
此外,如果将视野抬高到大模型层面,数据需求也非常庞大。
据凤凰网报道,OpenAI提交给欧盟的审查清单显示,GPT-6 Astra的训练数据包括文本超过10万亿token、图像超过10亿张、音频超过100万小时、视频超过100万小时。这一现象直观说明一件事——顶级模型已经开始认真对待物理世界相关的语料。
需求在膨胀,供给要跟上。觅蜂还发起了“场景数据联盟”,把场景方、采集网络、机器人和模型企业都聚集起来。这样能从需求提出、采集到训练、落地形成闭环。目前首批参与者已经达到50多家企业和机构。
如此看来,当下具身智能行业最具有确定性的生意之一就是数据和数据工具。
从目前来看,行业虽然不少宣传人形机器人进厂、进园区的案例,但机器人出货实际情况仍然大比例是训练、科研、验证相关。
当然这种现象很正常,任何一个新领域的发展都不是一蹴而就的。但这种现象也显示出具身智能当下还位于“发动机”还未点火的阶段——能力不够导致落地困难,补齐能力有需要真实数据,真实数据需要高效采集。现在有需求,立刻就要的就是数据。
那为什么这件事现在才跑通?
原因也很简单,本质上是选择不同。数采这个圈子基本上玩家分为两派,不少本体能力强的公司的数据都在自用;做数采生意的,反而是没有强本体或者是想做基座模型的。在这个视角看来,数据其实分成的是训练工具和定制产品的两种不同定位。
在这个格局里,觅蜂的选择是把数据彻底做成产品,交付给整个行业。
具身智能行业是个长跑。当Demo的冲击力开始失效,当客户和投资人要看到机器人具体的“功效”。产生营收,有持续现金流,将公司运营到具身智能“大结果”那天,才更重要。
或许在这个过程中,技术本身也不一定靠得住:可能出现新的技术范式,颠覆过去所有旧技术;也可能领先者的优势被快速追平,拉不开差距。就连现在采下的数据本身也会贬值——数采正在向多模态走,数据维度规格一升级,旧数据就折旧。
但众包模式恰好是一种对冲。分级体系能让低规格数据降级用于预训练和长尾场景,而非直接报废;根据需求“下任务订单”能随时重新发动的社会化采集网络,可以按新规格快速再生产。技术和数据会不断迭代,但生产能力不会。
但正如姚卯青所说,“很多行业的发展都证明了全民参与,最后才是质量最高的”。
短期,发动机已经点火,数据和工具可以先成交;长期,答案不在发布会上,而在下游是否复购,以及模型面对新场景时的零样本表现是否真的变好。
本文来自投稿,不代表增长黑客立场,如若转载,请注明出处:https://www.growthhk.cn/cgo/market/170715.html
微信扫一扫
支付宝扫一扫