具身智能行业的数据需求正在经历一轮量级跃迁。去年上半年,行业还在提几万小时的数据规模,今年已经有不少企业需求达到百万小时规模。要达到具身AGI(通用人工智能),业界普遍认为数据规模需要从百万小时扩展至亿级小时。
不过,数据采集的传统真机遥操模式瓶颈愈发明显,数采速度受机器人数量、操作人员和场地等条件约束,硬件、人力与运营成本随数据规模同步增加。无本体采集设备虽然降低了硬件门槛,但如果仅靠企业自身运营,仍然难以覆盖千行百业的长尾场景。
在这一背景下,众包模式正在成为具身智能数据采集的新方向。
分级处理海量数据
近日,觅蜂科技发布觅蜂派,公司称这是全球首个全品类高质量物理AI数据众包服务平台。用户下载APP后,可领取数据采集任务,佩戴MEgo设备在零售、仓储、制造、家庭等真实场景中完成指定操作,并按照有效时长获得相应报酬。数据显示,觅蜂派在为期一个月的内测期间,注册用户数达2万人,累计产生1.3万份采集任务提交。
记者了解到,目前觅蜂派覆盖22大类场景、5000多个任务和50000多个真实环境,具体包括物流、住宿服务、教育、养老照护、餐饮、零售、办公、医疗、交通出行等。
众包模式能够快速扩大产能,但也天然带来质量控制问题。具身智能数据采集从企业自建走向社会化生产之后,如何保证数据质量和稳定交付的问题?
觅蜂科技董事长兼CEO姚卯青在接受证券时报等媒体采访时表示,觅蜂派对数据的处理方式是不过滤、只分级。“不会对数据做非黑即白的划分,而是根据下游模型类型和训练阶段,对不同质量等级的数据贴上标签、分级保留。”
姚卯青进一步介绍,在数据自动化质检环节之后,超过95%的数据最终能被用起来。在空间精度上,在2D的原始素材里面,如何去提取6D高精度空间信息,行业已形成一定共识,“像5毫米、3毫米这种空间精度还是有的。”姚卯青说。
隐私与合规是众包模式的另一挑战。姚卯青介绍,觅蜂科技将对采集数据实施自动化脱敏,搭建五层防护机制,后台员工不会手动处理人脸信息。
运营能力成行业核心壁垒
从行业发展格局来看,目前具身智能数据采集赛道已有近百家玩家,除了觅蜂科技这样的平台企业之外,还有机器人本体公司、独立服务商、国企背景平台以及初创公司。姚卯青判断,行业后续会出现整合趋势,部分公司会专注于设备量产,部分公司负责运营,还有一些公司做数据后处理加工和分发。
“在具身智能数据采集行业,如果真正要进入到规模化以及盈利的状态,企业需要非常看重运营能力。”姚卯青表示,运营能力包括能否快速规模化运营人和场景,以及在运营过程中做成本优化和效率提升。同时,数采行业需要较多的资金前期投入,“我们应对今年1000万小时的数据,是大几个亿固定资产投入,不太适合几个人出来创业、融了几百万就能规模化干起来。”姚卯青透露。
姚卯青将众包采集模式的价值归结为“以销定产”。具体而言,以需求为主导驱动,而非盲目采集。据姚卯青透露,觅蜂当前从采集到后处理的成本已经能够实现全覆盖,单次出售已有较好的毛利率,“因为我们数据量越大,模型效果越好,从而人工占比就会更低、自动化程度更高。”
对于数据采集客户的结构,姚卯青将其归纳为三类:一是具身智能公司,希望做自己的基座模型;二是世界模型公司,自己不做本体,但需要无本体数据做预训练;三是大模型厂商,需要真实世界数据来提升多模态决策能力。
据姚卯青透露,目前已有头部客户预算达到千万小时级规模需求。众包模式不仅是数据采集产能的扩产手段,更是让真实世界经验进入模型训练的重要通道。在他看来,只有让各行各业的人参与进来,才能把每个人最真实的职业技能转化为机器人的训练素材。