公司动态

蚂蚁开源操作视频数据集,让机器人学习人类动作的门槛大幅降低

📅 2026/7/31 23:00:27
蚂蚁开源操作视频数据集,让机器人学习人类动作的门槛大幅降低
这项由蚂蚁数字科技、蚂蚁集团联合浙江大学、香港大学、香港科技大学广州、新加坡国立大学、北京智源人工智能研究院、中国科学院大学、香港科技大学及西安交通大学共同完成的研究于2026年7月以arXiv预印本形式公开发布论文编号为arXiv:2607.14183v2研究成果以开源形式向全球社区免费开放。**一、教机器人动手为什么那么难**教会一个机器人如何拿起一个水杯、擦干桌子或者叠一件衬衫听起来简单却是当今人工智能领域最棘手的挑战之一。语言模型可以通过海量网络文字自学成才但机器人学习动作技能需要的是真实的、有肢体动作细节的操作示范数据。这类数据不仅获取门槛高而且整理起来极为麻烦。过去研究者要么让专业人员穿戴昂贵的VR头盔或动作捕捉设备录制示范视频要么直接遥控机器人完成任务来积累数据。前者成本高且场景受限后者效率低且难以扩展到日常生活的多样性。正因如此机器人学习领域长期面临一个痛点数据量太少、场景太单一、格式五花八门、难以直接用于训练模型。蚂蚁数字科技领衔的研究团队正是为了填补这个空白而推出了Open-AoE这套系统。这个项目的核心理念很直白每个人口袋里都有一部智能手机如果能把普通人日常做家务、做饭、做手工时的第一视角视频收集起来再配上精准的手部动作标注、相机运动轨迹和动作描述那不就是机器人学习的天然教材库吗**二、手机摄像头变成机器人教练Open-AoE是什么**Open-AoE是一套完整的数据基础设施而不仅仅是一个视频数据集。打个比方如果机器人学习是一道复杂的菜肴那么以往的数据集只是给你一堆未经处理的食材而Open-AoE则是从选材、洗菜、切配、烹饪到装盘摆台的完整食谱加厨具套装。它的第一版本包含约2000小时的第一视角人类操作视频这些视频由超过500名志愿者贡献使用了400多种型号的智能手机覆盖400多种不同场景涉及超过8000种操作任务。视频本身是基础但真正让这套数据集与众不同的是附带的四类结构化标注信息自然语言文字描述、基于MANO模型的三维手部姿态、相机运动轨迹以及被精确定位到时间轴上的原子动作片段——所谓原子动作就是把一段完整操作切分成最小的、有独立语义的动作单元比如抓住瓶盖、顺时针旋转、向下按压。除了数据本身Open-AoE还开源了两套工具链一套是数据生产流水线负责把原始手机录像变成规范化的训练样本另一套是下游工具链帮助研究者把这些数据转化为可以用于训练各种机器人模型的格式。整套系统的源代码、文档和使用示例全部公开在GitHub上并同步在Hugging Face和ModelScope平台上提供数据下载。**三、数据从手机到教材四道严苛的处理关卡**一段普通的手机录像距离能够训练机器人的高质量数据中间隔着一条复杂的加工链。Open-AoE的数据处理流水线分为四个阶段每一阶段都像一道精密的过滤网。第一阶段发生在手机端用轻量级的视觉模型实时监控录像质量。系统会自动检测画面中是否有双手出现一旦手入镜就开始录制手消失就停止避免录下大量无效内容。与此同时系统还会监测佩戴姿势是否稳定、录制角度是否符合第一视角标准并通过语音提示告知使用者进行调整。在光线昏暗时系统会自动开启补光和曝光调节遇到设备过热或存储不足时会主动暂停录制。更关键的是在上传之前系统会对视频中可能出现的人脸和其他隐私信息进行本地模糊处理从源头保护采集者的隐私。这种端侧轻量化的设计让上传到云端的数据从一开始就是经过初步筛选的有效片段大幅节省存储和带宽成本。第二阶段是云端的离线质量检查与场景标注。这里又分三个子步骤。首先一批基于图像分析算法的规则型检测器并行运行快速剔除画面黑屏、曝光严重失当、文件损坏、时长太短或解码失败的视频接着检查录像中是否确实有双手可见排除固定机位拍摄或第三人称视角的片段以及抖动严重的片段然后对视频中残留的人脸、敏感信息进行再次检测和打码并把采集者的个人身份信息替换为匿名标识符这个映射关系被完整保存必要时可以授权逆向追溯。通过图像级别检查的视频会被切分成若干语义独立的片段每个片段的帧率也会被统一标准化。之后这些片段进入大模型检测环节。研究团队使用了Qwen3.7-Plus这个视觉语言模型从语义层面再次核查片段是否符合采集规范、操作动作是否完整且有目的性并为每个片段建立一套四层标签树分别对应领域、场景、任务和涉及的物体。这种分层标签体系让研究者可以按照厨房场景下的食材处理任务涉及菜刀和蔬菜这样的粒度快速检索数据。第三阶段是重建与标注也是技术含量最高的环节。相机轨迹的恢复使用了DROID-W这个SLAM同步定位与地图构建算法该算法的鲁棒核函数被专门针对手持和穿戴拍摄场景重新调优能够在剧烈抖动和身体运动干扰下保持六自由度轨迹的稳定性。手部三维重建则从一个专为AoE大规模第一视角数据训练的双手检测器开始这个检测器提供每帧的手部边界框并在帧间建立关联关系还能补全短暂遮挡时缺失的检测结果在此基础上HaWoR算法恢复出符合MANO参数化人手模型的三维网格通过SLAM结果对齐到真实尺度并转换到世界坐标系下滑动窗口优化保证了时间上的连贯性。最后对HaWoR重建结果和DROID-W提供的动态物体掩码做联合束调整bundle adjustment在统一的世界坐标系下同时优化手部网格和相机轨迹彻底消除分段重建带来的尺度漂移和坐标不匹配问题。从恢复的手部网格中提取出21个关节点的骨架坐标同时将每段视频切分成若干语义连贯的原子动作片段每个片段附上英文描述标签并由人工审核纠正模型产生的幻觉错误。第四阶段是三重质量门控与交付。完整性门检查手部重建有效帧的比例是否足够高确保姿态标注的可靠性正确性门检查逆运动学IK一种把手部姿态映射到机器人关节角度的算法失败率是否在低水平确保数据能被下游机器人系统实际使用一致性门检查相机轨迹是否平滑连续、相邻帧之间没有突兀跳跃。通过三重门控的数据还有一批随机采样的样本要经过人工抽检确认标注准确性并剔除严重遮挡或极端光线等边缘情况最终从完整数据池中精选出约2000小时作为开源发布版本。**四、数据有多丰富一次100小时的随机抽样告诉你答案**为了客观评估数据集的多样性研究团队从2000小时中随机抽取了100小时进行详细统计分析。从语义内容看这100小时中包含32407条不同的自然语言动作描述涵盖175种不同的动作动词和8030种不同的物体名称场景标签多达135种。厨房场景占比最高达到24.8%桌面或室内场景以23.3%紧随其后办公室或书桌场景占17.8%卧室占9.1%其余部分则分布在客厅、工作室、浴室、户外、洗衣房以及零售服务场景中。动作类型从切菜、缝纫、折叠衣物这类常见家务到处理葵花籽、穿针引线、整理硬币这类精细操作构成了一个广阔的操作动作库。从贡献者分布看这100小时数据呈现出明显的长尾分布——大多数贡献者只提交了少量视频贡献最多的10位采集者合计也只占总时长的13.7%中位数贡献量仅为每人2.6分钟。这种分布结构意味着数据集不会被少数人的操作习惯所主导从而保留了更广泛的手部动作风格、手部外观和拍摄环境变化。从设备多样性看仅这100小时样本就涵盖了400多个智能手机型号品牌覆盖vivo、华为、小米、OPPO、荣耀、真我等主流国内品牌。设备型号本质上是相机系统的代理变量不同型号意味着不同的镜头焦距、图像传感器、图像信号处理器、分辨率模式、曝光算法和拍摄固件。水平视场角FOV的分布呈现出三个峰值分别集中在65°至75°和90°至95°附近的两个区间三个最大的5度区间分别占比30.7%、30.2%和31.7%。这种多峰分布反映了不同相机和镜头配置的普遍存在而非单一光学系统的重复。当训练视觉策略的模型需要在各种未见过的相机、部署装置和机器人视角下正常工作时这种自然存在的传感器域随机性就构成了天然的泛化训练条件。**五、工具链从原始数据到可用模型的全套厨具**收集到数据只是第一步如何把这些数据变成机器人能学习的形式才是真正考验工程能力的地方。Open-AoE的工具链由三个功能模块组成彼此衔接形成一条从数据检视到模型训练的完整通路。第一个模块是可视化工具AoE-Visualization。它以第一视角原始视频为画布在上面叠加MANO三维手部网格、21个关节点的骨架线、未来一段时间内的手腕运动轨迹以及当前时间段对应的原子动作文字标签同时在旁边展示世界坐标系下的三维俯视图和时间轴。研究者可以用这个工具直观地发现重投影误差、手部缺失帧段、SLAM漂移和语义边界标错等问题而不是等这些问题被模型当成真实的运动规律吸收进去。第二个模块是重建与迁移工具AoE-Reconstruct-Retarget负责把第一视角视频变成机器人可执行的动作。它包含三条并行的处理路线。第一条是四维手部与物体重建使用EgoInfinity和Do-as-I-Do两套算法将单目视频提升为随时间变化的手部几何形状、物体六自由度姿态和交互资产AoE数据中的相机内参和度量尺度相机轨迹在这里发挥了关键作用帮助算法把观察者自身运动和场景中物体的运动分离开来。第二条是跨形态运动迁移核心问题是人类做的动作怎么让机器人也做出来。工具链集成了多个机器人平台的迁移后端Phantom方案把相机局部坐标系下的手腕和手指运动通过逆运动学加指尖重定向算法映射到宇树G1人形机器人配Dex3或Inspire灵巧手的关节轨迹Retarget Galbot方案把双手掌心目标位置转换为Galbot/Galaxea机器人的末端执行器轨迹和夹爪控制指令Retarget Lab还整合了EgoInfinity/G1、Do-as-I-Do/Sharpa和SPIDER/XHand等更多运动学和物理感知迁移方案。第三条是机器人化视频生成先用SAM2算法分割出人手和手臂的掩码再用E2FGVI或ProPainter算法把人手从画面中抠掉并填充背景最后把MuJoCo物理模拟引擎渲染的机器人动作合成叠加到原始场景中。生成的视频保留了真实场景的光线、被操作物体和任务进度只是把操作者的外观换成了机器人为人到机器人的视觉域迁移和机器人与场景一致性学习提供了对齐的配对数据。第三个模块是训练就绪工具AoE-Training-Ready负责把同步的视频、手部姿态、相机运动和语言标注转化为不同模型架构所需要的特定动作表示格式。这个模块的核心设计理念是没有一种动作向量适合所有下游任务所以工具链保留了信号的物理含义根据下游问题选择合适的表示层级。具体来说工具链暴露了五种不同密度的动作接口。最稠密的是110维的MANO状态/动作向量由左右手各一个55维向量拼接而成每个55维向量包含有效标志位、手腕三维位移、手腕轴角旋转、速度和45维MANO手形参数坐标系是当前帧的OpenCV相机坐标系单位分别是米、弧度和米/秒需要注意的是这个速度包含了手部运动和相机自身运动两部分。次稠密的是48维腕部-指尖向量包含手腕位置和旋转6D表示加上五个指尖的三维位置坐标系是SLAM世界坐标系用于H-RDT适配器。62维Sharpa格式包含左右手末端执行器位姿加Sharpa机器人关节角用于GR00T N1.7适配器。20维GR00T夹爪格式则是低自由度版本的GR00T适配器。最后是22维状态/20至26维本体动作格式用于SmolVLA、iVideoGPT、LAOM和GenieRedux等模型的适配器。对于视觉语言动作VLA策略模型工具链为VITRA、H-RDT、GR00T N1.7、SmolVLA以及基于LeRobot框架的π0.5、ACT和扩散策略等多种架构提供了现成的训练接口让研究者无需自行编写数据加载和格式转换代码。对于世界动作模型WAM即学习当前动作会导致什么未来状态的模型DreamZero、LingBot-VA、Ctrl-World和iVideoGPT等框架可以利用AoE提供的稠密手部状态或紧凑的手部加相机动作来学习动作预测和视觉动态。由于AoE同步了手部轨迹和相机轨迹模型可以把这两个因果来源作为独立的条件变量来处理为可控视觉预测提供了精准的监督信号。对于世界模型学习场景交互动态的生成模型GenieRedux、AdaWorld、LAOM和DreamDojo等框架可以从无标签视频出发学习潜在动作变量再逐渐用MANO手部运动和动作片段标注来监督这些潜在变量应该表示什么最终实现用显式手部运动控制未来视频生成——这条路线把无监督世界建模和有具身意义的控制信号自然地连接了起来。**六、与其他数据集的比较六个维度的横向测试**为了客观评估Open-AoE与现有数据集相比的差异化价值研究团队选取了OpenEgo、EgoDex和EgoXtreme三个代表性数据集进行多维度比较每个数据集各取约100小时EgoXtreme规模较小使用其全部可用数据。视觉多样性的测量借助了CLIP图像嵌入一种把图像压缩成高维向量的预训练视觉特征。研究者进行了3000次平衡随机采样实验每次从四个数据集中各取2000张图像嵌入计算六个不同角度的多样性指标。有效秩衡量特征分布在多少个活跃方向上展开类似于一个发光体究竟照亮了多少个不同方向参与率衡量特征方差是否集中在少数方向还是均匀分布有意义覆盖率统计在共享特征空间中有多少个区域被稳定占据归一化聚类熵和有效聚类数衡量特征在这些区域的分布是否均衡k近邻域混合度测量某数据集的样本与其他数据集的样本在特征空间中的局部混合程度越高说明视觉风格与其他数据集的重叠越多视觉范围越广。在全部六项指标上Open-AoE均排名第一有效秩97.4参与率40.5有意义覆盖率19.9归一化聚类熵0.712有效聚类数16.3k近邻域混合度0.078。尤其是有效秩和k近邻域混合度两项优势最为显著说明Open-AoE不仅特征分布在更多方向上展开而且与其他视觉域的局部连接更强。语义广度和时间覆盖方面Open-AoE拥有32407种不同的自然语言动作描述相比之下OpenEgo有26864个原生标签而EgoDex只有111个类别标签。时间覆盖率方面Open-AoE的标注覆盖了被评估时间轴的99.99%而OpenEgo的时间覆盖率只有50.1%标注密度为每分钟13.97个片段平均片段时长9.64秒EgoDex每分钟片段密度略高14.31个但词汇量远小于Open-AoE。图像与标注一致性的评估使用了Idefics2这个视觉语言评估模型对每段视频随机抽帧请模型判断该帧画面内容与标注描述的吻合程度打分范围1到5分。Open-AoE的序列宏观平均分达到4.58395%置信区间为[4.557, 4.608]其中85.4%的序列平均分在4分以上OpenEgo得分3.029EgoDex得分2.916EgoXtreme仅得2.015。这个结果说明Open-AoE的标注不仅广而且准——绝大多数标注与视频内容高度吻合。训练样本产出率和多模态完整性的评估使用了一个实用导向的测试以2秒历史窗口、2秒未来窗口、2秒步长的方式在每段视频上滑动提取训练样本统计每小时能产出多少有效样本。理论上限是每小时1800个样本3600秒÷2秒步长。Open-AoE的实际产出率为每小时1760个达到理论上限的97.8%说明其序列的时间连续性非常好序列边界造成的损失极小。OpenEgo同样达到了98.9%的高产出率但EgoDex只有68.1%说明其视频片段较短边界损耗较大。手部信号可用性方面Open-AoE有98.93%的帧包含至少一只手的有效信号98.02%的帧同时包含双手的有效信号远高于OpenEgo单手有效率66.2%双手有效率55.6%。监督模态完整性的检查涵盖动作标注、边界框、标注置信度、手部姿态和相机姿态五项Open-AoE是唯一一个五项全部具备且覆盖率接近100%的数据集。边界框质量同样优异100%有效框98.39%完全位于图像边界内平均置信度0.947第10百分位置信度0.950。**七、开放生态的愿景数据不再是具身智能的瓶颈**说到底Open-AoE想解决的问题不是数据够不够多而是数据能不能用。这套系统把数据采集、处理、重建和训练打通成一个可持续运转的闭环从手机端的轻量实时质控到云端的多阶段清洗标注再到面向模型的格式转换接口每一个环节都是开放的、可复用的。一个想研究手部动作生成的学者、一个想训练机器人策略的工程师、一个想研究视觉世界模型的研究生都可以从这套基础设施的不同位置切入拿走自己需要的那部分而无需从头搭建私有的数据处理栈。研究团队也明确表示Open-AoE的目标是成为一个由数据贡献者、高校、科研机构、机器人开发者和模型团队共同演进的开放生态而非一个静态的数据包。社区可以不断提交新的真实场景和任务、新的重建与迁移方法、新的训练适配器和评估结果让数据、工具和模型在开放循环中一起成长。这当然不是终点。数据集自身也有局限——视频来源于普通手机而非精密传感器三维重建的精度不可能与运动捕捉系统相媲美镜头模糊、遮挡和极端光线环境仍会影响部分样本质量相机域多样性对模型泛化能力的具体贡献也还需要通过严格的消融实验来验证。但它所做的事情是把用普通手机拍的视频训练机器人这条路走通了一大段让从人类日常行为到机器人可执行动作的知识迁移有了一套开放的、可扩展的、可复用的基础设施。对于正在探索具身智能的研究者来说这套基础设施的价值可能远大于数字本身。有兴趣深入了解的读者可以通过论文编号arXiv:2607.14183查阅完整原文。QAQ1Open-AoE数据集和其他第一视角数据集有什么区别AOpen-AoE最大的区别在于全套配件。现有数据集大多只提供视频本身而Open-AoE同时提供了三维手部姿态、相机运动轨迹、精确到秒级的动作分段和自然语言描述并且配备了从数据采集到模型训练的完整开源工具链。在对比测试中Open-AoE在视觉多样性、标注覆盖率、图像与标注一致性以及训练样本产出率等六项指标上均排名第一是目前唯一一个五类监督信号动作文字、边界框、置信度、手部姿态、相机姿态全部具备且覆盖率接近100%的公开数据集。Q2Open-AoE的数据是怎么保护参与者隐私的A隐私保护在采集流程的最源头就开始了。手机端的应用会在上传前对视频中的人脸和敏感信息进行本地模糊处理。数据上传到云端后服务器会再次检测并打码残留的面部和隐私区域同时把采集者的姓名、联系方式等个人身份信息替换为匿名标识符目录名和元数据字段也一并重写。最终公开发布的数据中不包含账号信息、支付信息或其他个人元数据且所有参与者在参与前均已知情同意并确认上传。Q3普通人可以给Open-AoE贡献数据吗怎么操作A可以。Open-AoE专门开发了一款名为AoE Capture的手机应用安卓和iOS版本均可下载。安装后使用者佩戴手机通常固定在前额或胸前进行日常操作时应用会自动检测手部入镜并开始录制手消失后自动停止同时实时语音提示调整姿势和角度。录制完成后使用者在本地审核视频并确认上传。系统会自动完成隐私处理和格式检查符合标准的片段才会进入数据库。这种设计让贡献数据的门槛降到只需要一部普通智能手机。