具身智能等不到 ChatGPT 时刻?答案可能藏在真实数据里
具身智能被吹了很多年。
先吹硬件,再吹本体,再吹人形机器人,后来又吹 VLA、世界模型和机器人大脑。
但一个尴尬的问题一直没变:
机器人到底什么时候真正能干活?
2026 年,资本开始给出一个新答案:也许拐点不先出现在模型里,而是先出现在数据里。
最近,具身数据突然变热。量子位统计,过去一年,仅 15 家“不做本体、不做模型、只做数据”的独立具身数据服务商,就拿走了约 44.7 亿元融资。
银河通用推出“银河星坊”数据基建,星海图联合北京亦庄共建数据公司,并启动“百万小时真实数据计划”。各地也在建设具身数据采集中心、遥操作基地和数据工厂。
这说明行业正在形成一个新共识:
真实世界数据,可能会比模型更早成为具身大脑的 ChatGPT 时刻。
如果按 36 氪 / 量子位的行业分类来看,当前具身数据主要有几条路线:真机遥操、无本体采集、仿真合成、互联网视频蒸馏,以及数据 infra 平台。
但如果按商业价值排序,逻辑会更直接:
真实业务现场真机数据 > 真机遥操数据 > 无本体数采 > 仿真合成数据 > 互联网视频蒸馏数据。
不是后几类没有价值,而是越靠前,越接近机器人真正要面对的物理世界。
采集场里能拿到动作样本。
真实现场里,才能拿到任务经验。
而任务经验,才是机器人大脑真正长大的养料。
一、仙工智能:具身智能公司,天然真机数据最容易被低估
仙工智能代表的是具身智能公司中最容易被低估的一类。
它不是垂直数据公司,而是一家刚刚上市的平台型具身智能机器人公司,核心产品是机器人大脑,也就是具身智能机器人的核心控制器。
公开信息显示,仙工智能已服务 2100+ 全球客户,覆盖 20+ 行业、70+ 国家和地区。目前仙工智能累计有 50000 台AI 机器人在真实业务现场运行,即使每天只有 20% 的设备数据回流,每台设备每天工作 10 小时,一年按 300 个工作日计算:
50000 台 × 20% × 10 小时 × 300 天 = 3000 万小时
也就是说,仙工智能每年实际可沉淀的高质量真机数据,可能达到 3000 万小时级别。
这类数据不是采集场里摆出来的动作,而是真实客户、真实设备、真实流程里自然长出来的任务经验。
别人是在搭场采数据。
仙工智能是在业务运行中自然长出数据,数据成本无限趋近于 0。
这也是它最容易被低估的地方:它看起来不是数据公司,但可能天然拥有最值钱的数据资产。
数据够多样,格式够统一,来源够真实,成本够可控,增量可持续。
数据多样、格式一致好训练、真机数据、可持续、低成本。
具身智能数据重要性提升的现在,这匹黑马值得关注。
二、星海图:具身智能公司,百万小时真实数据计划
星海图代表的是具身智能公司主动建设真实数据计划的路线。
2026 年,星海图联合北京亦庄共建数据公司,并启动“百万小时真实数据计划”。这意味着,头部具身智能公司已经开始把真实数据作为基础设施来建设,而不是把数据当成模型训练的附属资源。
这条路线的优势很明显:目标清晰、组织化程度高,可以围绕自家机器人、本体和任务体系形成稳定数据积累。
但它也有一个核心问题:集中采集的数据,能不能真正覆盖复杂业务现场?
如果答案是能,它会成为具身大模型的重要燃料。
如果答案是否,它就仍然只是更大规模的动作样本库。
三、银河通用:仿真合成路线,虚实融合提升训练效率
银河通用代表的是仿真合成路线中的头部玩家。
其推出的“银河星坊”数据基建,本质上是用合成数据扩大训练规模,再用真实数据进行校准和场景回流。
这条路线的优势是效率高。
单靠真机采集,很难快速满足通用机器人训练所需的数据规模。仿真和合成数据,可以让机器人更快覆盖更多任务、更多环境和更多边界情况。
但它的挑战同样清楚:仿真里能跑,不代表真实世界能干。
虚实融合最终必须回到真实现场验证。
所以银河通用的看点,不只是“能不能造更多数据”,而是“这些数据能不能穿透 sim2real gap”。
四、光轮智能:独立数据服务商,具身数据卖铲人
光轮智能代表的是独立数据服务商路线。
它不做通用机器人本体,也不训练具身模型,而是围绕物理仿真、数据生成、数据处理和模型评测,提供具身数据基础设施。
量子位统计显示,光轮智能过去一年融资额约占 15 家独立具身数据服务商总融资额的七成,是目前具身数据赛道中最受关注的独立服务商之一。
这类公司的商业想象力很清晰:如果具身数据成为上游资源,那么数据服务商就是卖铲人。
但它们也要面对最现实的问题:纯卖数据,到底是不是一门能持续赚钱的生意?
资本已经给了热度。
接下来要看利润表。
五、诺亦腾:无本体采集路线,低成本扩充动作样本
诺亦腾代表的是无本体采集路线。
无本体数采的核心,是不依赖机器人本体,而是通过动作捕捉、手套、夹爪、第一视角相机等设备,先采集人类动作,再把数据映射给机器人学习。
这条路线的优势是轻、快、便宜,适合大规模补充动作样本。
但它的短板也很明确:人类动作不等于机器人动作,人类能做的事,机器人不一定能以同样方式完成。
所以无本体数采可以补动作库,但很难替代真实业务现场里的任务闭环数据。
它是很好的补充燃料,但不是最终答案。
结语:具身智能的 ChatGPT 时刻,也许先从数据开始
过去,行业总以为具身智能的 ChatGPT 时刻会来自某个超级模型。
但现在看,事情可能反过来。
在通用机器人大脑真正爆发之前,最先被重新定价的,可能是真实世界数据。
采集场能提供动作样本。
仿真系统能提供训练规模。
数据平台能提供供给效率。
但真实业务现场,才能提供任务经验。
具身智能的下一次进化,不只是模型变强,而是机器人终于开始拥有足够多的真实世界经验。
如果说芯片是机器人大脑的算力底座,存储是机器人大脑的记忆容器,那么真机数据,就是机器人大脑理解物理世界的养料。
芯片决定机器人大脑能不能算。
存储决定机器人大脑能不能装。
真机数据决定机器人大脑能不能长大。
也许,真正的 ChatGPT 时刻,不是机器人突然会说话。
而是它终于在真实世界里,学会了干活。 $仙工智能(06106)$
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


