来源:环球网
【环球网科技综合报道】近日,基于具身模型信息密度定律与以人为中心的环境式数据采集方案2.0,并依托环境式采集引擎ACE,大晓机器人宣布联合南洋理工大学 S-Lab 开源 L5 级多模态具身物理智能数据集 ACE-Data-0。通过对真实物理交互、长程任务过程与多模态因果信号的高保真采集和高精度标注,ACE-Data-0 为全球具身模型提供面向泛化、反思与进化的高质量数据底座,推动通用物理智能加速跨越实验验证,走向规模化产业落地。

具体而言,ACE-Data-0 包含 150 小时数据、1700 万帧视频、200 个任务类别、50 名参与者、2 个真实家庭场景和 7.5 万个交互片段,覆盖原子级人—物交互、长时序家庭场景活动链及人与场景交互。数据同步采集第一人称视频、多视角第三人称视频、全身与手部运动、物体六自由度轨迹、多通道音频与触觉信号,并将全部模态对齐至同一时间线和空间坐标系,完整保留人类感知、行动、接触与环境变化的连续过程。
基于 ACE-Data-0,大晓进一步构建了从底层信号、场景组成要素到具身交互理解的三级评测基准,系统检验模型在接触感知、人体与物体状态恢复、手—物交互理解等关键环节的真实能力。ACE-Data-0 因此不只是一批家庭场景活动视频,更是一套面向模仿学习、世界模型、视觉—语言—动作模型(VLA)、机器人策略学习及人类示范向机器人迁移的具身数据基础设施,为通用物理智能走进真实世界提供更完整、更可扩展的数据底座。
据介绍,ACE-Data-0 覆盖三类互补任务。第一类是原子级人—物交互,单次约3分钟,包括倒水、清洗、擦拭、切割、折叠和整理等单项操作,即使最短序列也以分钟计,而非传统HOI数据中常见的数秒片段;第二类是多个原子动作组成的长时序家庭场景活动链,可持续20—30分钟,例如从打开冰箱、取出食材,到清洗、切配、烹饪、装盘和收拾;第三类是人—场景交互约5分钟,包括移动、坐下、锻炼、开关家具、取放物品及姿态转换等。
基于 ACE-Data-0,大晓还建立了由底向上的三级具身感知评估基准。第一级是底层信号推断,研究模型能否从视觉观测中预测接触与触觉信息;第二级是场景组成要素恢复,评估模型在遮挡、复杂姿态和持续运动下恢复人体与手部运动状态的能力;第三级是具身交互理解,要求模型从第一人称和第三人称视频中恢复接近、抓取、调整和释放等完整手—物交互过程。
在大晓机器人看来,ACE-Data-0 的价值也不止于评测。由于第一人称视频、多视角第三人称视频、人体与物体轨迹、音频、触觉和语言标注处于统一时空框架,它可以进一步服务于模仿学习、机器人策略学习、世界模型、VLA,以及人类示范向不同机器人本体的迁移。未来,大晓机器人将继续围绕具身数据引擎、通用具身基础模型、世界模型和 VLA 推进研发,并与研究机构、开发者及产业伙伴共同探索从人类自然行为到机器人通用能力的可拓展路径。(青山)