贵州省大数据局今年7月公布的数据显示,当前国内真实物理交互场景合规数据仅50万小时,而机器人商业化落地需要数千万小时数据,缺口超99%。
具身智能产业面临严峻的数据“饥渴”难题。8月6日,成立于2025的具身智能企业黎曼动力宣布,与两家具身数据公司光轮智能、诺亦腾机器人合作,计划2026年底完成100万小时具身数据的采集与训练。三方围绕Riemann-1.0具身世界动作模型与Matrix-Game 3.5交互式世界模型,将在高质量具身数据采集、模型训练、规模化评测、真实机器人部署与反馈优化等方向展开合作,构建覆盖数据、评测、模型迭代与真机部署的具身智能基础设施。
具身智能模型要真正理解和操作物理世界,仅依赖视觉信息远远不够。机器人不仅需要“看到”物体,还需要理解手指抓握时的力度变化、人体关节运动状态、动作在三维空间中的连续轨迹,以及人与物体、环境之间的动态交互关系。这些涵盖人体动作、力觉反馈、环境变化与交互对象状态的高精度多模态数据,是构建下一代机器人通用大脑的重要基础。
但具身智能所需的高质量物理交互数据严重匮乏。中国机电一体化技术应用协会今年7月发布的《2026中国具身智能产业发展报告》显示,真机数据采集成本极高且难以复用,传统遥操作数据采集的成本约为每有效数据条10-50元人民币,训练一个基本可用的机器人操作策略通常需要数万到数十万条数据,数据采集面临成本高和效率低两大核心挑战。
与此同时,企业各自采集工况数据形成“数据孤岛”,设备故障、极端环境等稀缺样本难以共享,导致实验室训练的模型在真实环境中误差偏大。为了解决数据瓶颈,行业正多路径探索,一方面建设大规模数据采集工厂,另一方面利用仿真平台自动生成标注数据,此外还可以通过互联网视频学习(Video-to- Action)降低对真实机器人采集的依赖。
清华大学交叉信息研究院助理教授、破壳机器人创始人许华哲曾表示,数据是具身智能最核心的要素,相当于企业的核武器。具身智能的大前景正是因为Scaling law的存在,否则将永远达不到通用性。他认为,数据Scaling始终是最重要的事,无论选择哪种模型路线,数据都是不可动摇的前提。实现数据Scaling的关键,并非写代码本身,而在于对数据分布进行有效度量。在收集数据时,必须将直觉转化为可度量的数字,就像数据分析一样,才能确保数据分布覆盖足够广,否则重复抓取同一物体数万次也没有意义。
澎湃新闻记者 张静