2026年09月28日 星期一 首页 科技 财经
首页 > 财经 > 正文

千万小时缺口下的突围:谁在为中国具身智能“喂”数据?

如今,人们多了一种赚外快的方式,每天下班回家做饭、做家务的时候,戴上一台轻巧的头环设备,按下按钮,把自己干活的过程录下来,上传到一个手机应用里。叠衣服、整理文件柜、陪孩子搭积木......这些人们生活中平时的日常动作,如今每个月能给普通人带来三千多元的额外收入。

而参与其中的人可能并不知道,他们正在参与一场也许能改变未来的竞赛。大语言模型靠互联网上海量的文本学会了说话和写作,而机器人要学会拧瓶盖、叠衣服、修水管,需要的是一个记录动作的数据库,而这个数据库需要行业从头构建。

具身智能的iPhone时刻差了一本教材

过去两年,具身智能以前所未有的速度从实验室走向现实,机器人已经能翻跟头、跳舞、格斗,但真正要走进工厂、商店和千家万户去干活,还差一块关键拼图:海量、真实的人类动作数据。

觅蜂科技董事长兼CEO姚卯青的回答很直接:答案在数据。大语言模型之所以爆发得如此之快,是因为它学完了人类过去四十年沉淀在互联网上的知识印记;而机器人要学的动作和技能,互联网上根本没有一个现成的载体替它们记录。换句话说,机器人缺的不是聪明的大脑,而是教材。

这个缺口有多大?中国信通院人工智能研究所联合人形机器人(上海)有限公司、具身智能测试实验室发布的《具身智能训练场研究报告(2026年)》给过一组测算:具身基础模型要迎来自己的"ChatGPT时刻",至少需要千万小时级的真实数据;如果这些数据全部靠真机采集,按每台机器人每天有效工作2小时、每年工作300天计算,需要超过两万台机器人连续工作整整一年。而现实是,当前全球可用的高质量真实数据,只有数十万到百万小时级,供需之间隔着一整个量级。

数据的杠杆效应,已经在海外被验证过。今年9月,美国人形机器人公司Figure发布Helix 2.5模型,租下旧金山湾区30套陌生住宅,让机器人不采新数据、不做现场训练,直接盲测整理客厅、叠毛巾、铺床三项家务:用人类行为数据集Index做过预训练的模型,完整任务成功率达到56%;而对照组从随机权重起步,成功率只有9%。这个差距也直接行业开始看到人类行为数据预训练的真正价值——它让机器人第一次能在陌生环境里“直接上岗”。

与此同时,姚卯青与我们分享了他观察到的一个变化:行业对数据的需求曲线正在陡峭地向上走。去年上半年,市面上很少有人提几十万小时规模,大家还停在一万小时的量级;到去年底有人做到20万小时;今年很快就有公司宣布用到100万小时,而他接触到的客户,提出的已是千万小时级的预算。“不是简单地堆量,”他强调,“而是越来越往细分赛道、专业技能上去获取。”叠衣服的数据已经泛滥,修水管、修车、理发、美甲,这些“长尾技能”正等待被一个个点亮、解锁。

在此背景下,具身智能的数据故事才刚刚翻到第一章,在数量的缺口之外,质量和场景多样性的缺口同样悬而未决。谁能持续把真实世界的经验转化为可训练的数据,谁就握住了下一个十年的入场券。

混乱的数采江湖等一个答案

具身智能数据采集看上去简单,但实际采集的时候却困难重重,且目前行业仍处于发展的初期阶段,行业仍有些混乱。

行业此前最通行的做法是真机遥操作:人通过手柄或VR设备操纵机器人,把任务操作示范给模型。这类数据与本体高度对齐,训练价值高,但短板同样明显——采集速度被机器人数量、操作人员和场地死死捆住,硬件、人力与运营成本随数据规模同步上涨。信通院报告显示,截至2026年6月底全国已建成启用超70家具身智能训练场,另有46家在建或规划中,但训练场属于典型的重资产投入,仅部署100台人形机器人,本体采购成本就可达数千万元;场景集中在少数易采集任务上,数据泛化价值有限,可持续盈利模式仍在摸索。

更深的痛点在场景本身。觅蜂科技副总裁殷哲将数据采集比作挖矿:设备是工具,运营是工厂,场景资源才是要挖的矿。“在整个物理AI数据链条里,场景是唯一无法被技术或资本快速复制的源头。”殷哲强调。

当前国内真实物理交互场景的合规数据大约只有100万小时,而机器人商业化落地需要千万甚至数亿小时,缺口超过99%。更麻烦的是,场景进入有壁垒,比如,设备进食品厂安全吗?老板让不让众包员带设备进工厂?姚卯青打了个更形象的比方:场景像页岩油,有价值,但如果开采成本比采出来的油还贵,就等于没有。

除此之外,当前具身智能数据采集行业也尚处于混沌阶段,行业鱼龙混杂。从今年上半年起,大量初创团队涌入这个赛道,普遍以技术背景创业为主,早期快速做出以相机为主的原型设备。对此,姚卯青判断,这个行业真正要进入规模化乃至盈利状态,看重的是运营能力。而运营能力主要体现在,企业能不能“以销定产”、精确匹配需求,以及能不能在设备制造、人员雇佣、结算、云端基础设施建设上砸下重资产。基于此,姚卯青判断行业整合是必然,未来会分化出设备方、运营方、后处理方,不会人人都干整条链条。

乱象之下,还有一些更根本的分歧。一种主流做法是要求采集者放慢动作、保持手部持续可见,迁就现有算法的解析能力。但争议随之而来:当人开始迁就算法,真实世界里本就存在的快速运动、遮挡和纠错被人为收窄,模型最终看到的行为分布也随之失真。海外有公司批量买回数据,花大量人力清洗,最后能喂进模型的有效数据率只有10%左右。此外,众包采集要进入真实家庭和商业场所,人脸、住址等隐私信息如何授权、如何脱敏,都是目前行业在数据采集过程中必须要面对的难题。

把数据做成一份货架上的生意

面对当前行业的痛点,觅蜂科技给出的答案是,把采数据的铲子交到每个普通人手里。

在姚卯青看来,教会机器人的数据其实从来不缺:酒店阿姨整理床品、餐饮服务员备餐打包、物流分拣员搬运转运、工厂师傅装配上下料,每天每分每秒都在发生。缺的只是去开采这座宝藏的铲子,“这也是我们推出觅蜂派APP的主要原因:就是让任何人实名注册、申领一台MEgo设备,在正常生活和工作之余顺手完成采集不需要培训,没有面试,从领任务到拿钱四步走完。”姚卯青言简意赅的介绍了觅蜂科技推出觅蜂派APP核心因素。

将觅蜂派APP拆解来看,其背后是觅蜂自研的MEgo View头戴设备以多相机覆盖超过300°视角,腕部相机捕捉手部细节;MEgo Gripper作为无线UMI类设备,空间轨迹重建精度达到毫米级,三维触觉可记录“手在哪里、用了多大力”,全通道硬件级同步做到亚毫秒级。数据回传后,MEgo Engine云端引擎完成切片、标注、空间信息提取,再通过ManiEval体系从数据、任务、传感器、语义、动作五个维度逐一质检。

值得注意的事,在数据质量层面,姚卯青明确表示不会做非黑即白的分化:“数据质量可以分很多层,根据不同下游模型类型或者不同模型的训练阶段,可以利用不同质量等级的数据。我们会给它贴上质量标签,把它们尽可能保留下来。”姚卯青指出,据他介绍,过了结算环节后,超过95%的数据最终能被用起来,70%-80%可保留至精细化处理阶段。

据姚卯青介绍,目前觅蜂科技已经将2万套MEgo设备陆续“派”到了家庭、办公、零售、生产、餐饮等真实场景,累计采集有效数据达百万小时,百万小时级无本体数据已开始服务腾讯Robotics X实验室、蚂蚁灵波等头部客户。

而在产业层面的布局则围绕“场景”二字展开。据悉,觅蜂科技发布了覆盖22大类场景、5000余个任务、50000多个真实环境的任务货架,并发起场景数据联盟,东呈酒店、中旅集团、华驿酒店、陈香贵、普亲养老院、上海德济医院、正荣集团、龙旗科技、张江集团等50余家企业和机构成为首批成员。“客户需求已从粗放的工厂数据,精细到某条产线上拧螺丝的L3级,场景不提前储备,需求来了就接不住。”这是殷哲对为什么要牵头场景数据联盟的解释。

至于数据需求的终点在哪里,在姚卯青看来,AI要进入下一阶段,必须进入物理世界闭环决策,各家公司的数据预算越挂越高,越多越好、越丰富越多样化越好。真实世界浩瀚无垠,而人类每一次平凡的动手,都可能成为智能进化的一次投喂。

(文|Leo张ToB杂谈,作者|张申宇,编辑丨杨林)

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

本文为转载内容,版权归原作者所有,原文链接:https://www.tmtpost.com/8153852.html