公司动态

RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型

📅 2026/7/24 14:21:44
RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型
26年6月来自阿里达摩院、香港具身智能实验室、港中文、阿里湖畔实验室和蚂蚁集团的论文“RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation”。扩展机器人学习规​​模需要海量且多样化的轨迹数据但目前数据采集受限于物理遥操作模式因为每一次演示都需要操作员将时间投入到特定的硬件和工作空间中。提出一种“数字遥操作”范式通过利用生成式世界模型替代真实机器人实现数据采集与物理约束的解耦。在该框架下操作员的手部姿态流驱动一个以机器人为中心的生成式世界模型仅需单张参考图像即可合成高保真的自我视角egocentric视频。记录下的姿态流作为一种与具体具身形态无关的动作标签可通过标准的重定向retargeting技术迁移至任意目标机器人从而生成用于模仿学习的完整状态-动作轨迹且无需依赖物理硬件。这一范式具体实现为 RynnWorld-Teleop 系统该系统集成-觉察骨架条件控制、基于视频扩散 Transformer (DiT) 的渐进式人机动作映射训练以及流式自回归蒸馏技术。该流程将生成过程压缩为单次推理使得在单张 H100 GPU 上即可实现超过 40 FPS 的实时交互式生成。仅使用 RynnWorld-Teleop 生成数据训练出的策略在多种灵巧双臂操作任务中均实现有效的零样本zero-shot仿真-到-现实Sim2Real迁移。此外利用数字遥操作数据增强真实世界数据集能持续提升任务成功率这表明 RynnWorld-Teleop 可作为下一代机器人智体的高保真、可扩展数据引擎。机器人领域的最新进展——例如视觉-语言-动作VLA模型Black et al., 2024; Brohan et al., 2022; Kim et al., 2024; Li et al., 2026b; Zhao et al., 2026b和世界模型Agarwal et al., 2025; Ali et al., 2025——展现了实现通用自主性的巨大潜力但数据匮乏问题依然严重制约着其发展Zhao et al., 2026a; Lepert et al., 2025a; Zhao et al., 2023。若能获取此类大规模机器人数据将简化训练流程并有望突破性能上限。尽管传统的遥操作系统Li et al., 2025b; Ze et al., 2025; Zhao et al., 2025a能提供高质量的专家数据但它们往往局限于固定的实验室环境和特定的操作对象Zhao et al., 2025b; Guo et al., 2026; Zhao et al., 2024。手动重置环境所需的高昂成本以及获取多样化现实世界物体的物流挑战使得这些系统难以捕捉交互中的长尾分布情况。因此在非结构化环境中实现稳健的泛化能力仍是一项尚未解决的难题仅靠物理平台本身无法克服这一障碍。本文提出一种将操作员时间与物理基础设施解耦的方法即利用生成式机器人替代真实机器人。这种范式称为“数字遥操作”操作员的实时手部姿态流被输入到一个生成式世界模型中该模型以目标场景的单张参考图像为条件合成出机器人若实际执行该动作时会产生的“自我中心视角”egocentric视频图1所示。关键在于由于生成的视频基于操作员关节级的手部姿态记录下的动作本身便构成了一种与具体机器人形态无关的“真值”ground-truth动作标签通过标准的重定向retargeting流程这些标签可迁移至任何具体的机器人形态上。生成的视频提供了相应的视觉观测结果由此产生的轨迹数据可直接用于下游的模仿学习而无需实际操作物理机器人。如果数字遥操作技术得以实现机器人数据采集将仅受限于操作者的想象力而不再受限于物理基础设施的制约。近期有两类研究触及这一目标但未能完全弥合其中的差距。一类是“人到机器人”的视频转换方法Lepert et al., 2025a; Li et al., 2025a; Lepert et al., 2025b; Song et al., 2025它们试图通过渲染或转换将人类演示画面中的主体替换为机器人形态从而弥合视觉差异。尽管这些方法跨越了视觉鸿沟但它们本质上是被动的、仅限于观测的底层机器人动作并未实际生成且庞大的 扩散TransformerDiT骨干网络也排除了闭环交互的可能性。另一类是基于动作条件的自我中心世界模型Hao et al., 2026; Wang et al., 2026, 2025b; Xie et al., 2026; Tu et al., 2025它们更进一步能够根据人类控制信号合成未来帧但仍以人类为中心。渲染出的手部图像依然是人手未能弥合“具身形态”embodiment上的差异。一个真正的数字遥操作系统必须同时满足以下条件(i) 以机器人为中心使操作者能够遥控机器人(ii) 基于动作action-grounded确保生成的每一帧画面都与可还原的关节级动作信号相关联以及 (iii) 具备实时性使操作者能保持在控制回路中从而将复杂的技能序列串联起来。此前尚无框架能同时满足这三点要求。为此本文提出 RynnWorld-Teleop这是首个在上述严格意义上实现数字遥操作的系统如图 1 所示。RynnWorld-Teleop 是一个以机器人为中心、基于动作条件的世界模型它能以支持实时控制的帧率输出高质量、交互式的自我中心视角视频。给定参考图像 I_ref 和手势序列 P{p_1, . . . , p_T}RynnWorld-Teleop 能够合成高保真的机器人视角egocentric视频 V {v_1, . . . , v_T}。为了弥合人类意图与机器人执行之间的具身差异embodiment gap其框架整合以下要素(i) 深度感知的动作表征与任务专用架构(ii) 用于实现从人类到机器人知识迁移的两阶段渐进式训练范式以及 (iii) 支持实时交互式生成的自回归蒸馏过程。1 预备知识RynnWorld-Teleop 基于 Wan-I2V 架构Wang2025a构建该架构采用 3D 变分自编码器VAE和基于 Transformer 的去噪器 F_Θ。其训练目标遵循条件流匹配CFM框架Lipman2022。给定初始图像潜变量 z_0 E(I_V)前向过程构建一条连接数据与噪声的概率路径z_t (1−t)z_0 tε, ε∼N(0,I) 其中 t ∈ [0, 1]。网络 v_Θ 经过训练基于参考图像的潜表示 z_ref E(I_ref) 和深度-觉察骨架控制潜表示 c 来预测速度场 L_CFM。在推理阶段为了实现实时响应系统利用经过蒸馏的因果学生模型distilled causal student求解由 v_Θ 定义的常微分方程ODE来生成视频。2 深度-觉察动作表征将动作表征为基于21个关节点手部追踪生成的骨架视频序列。为了解决标准二维投影中固有的深度歧义问题这对精确建模手与物体的交互至关重要采用一种深度调制渲染技术。具体而言每个关节点和骨骼的深度编码颜色映射及直径均根据其在相机空间中的深度进行动态缩放如图2所示。这种表征方式有效地整合了手部的关节结构信息与操作所需的空间线索。为确保控制信号与视频生成流程兼容利用预训练的VAE编码器将渲染出的姿态视频投影到潜空间。由此生成的控制潜向量 c 在空间和时间维度上均与目标视频的潜向量对齐从而实现了动作与外观之间细粒度的关联映射。3 基于动作条件的视频生成基于视频扩散 Transformer (DiT) (Wang et al., 2025a) 构建世界模型利用手部姿态序列作为物理动作的高维代理以此作为生成过程的条件。姿态到视频的条件控制。其模型遵循“图像-到-视频”的范式给定参考图像的潜表示 z_ref 和控制潜表示 c模型预测后续的运动。为了整合姿态信息采用一种结合分布对齐的加性 Patch 嵌入patch-embedding方案其中引入一个专用的控制补丁嵌入层 PatchEmbedc_C→D与原有的视频补丁嵌入层 PatchEmbedz_C→D 并行运行。这确保在整个训练过程中相加的控制信号始终与预训练的视频流保持统计兼容性。为了保留生成先验PatchEmbedc采用零初始化而门控标量 α 则初始化为一个较小的值例如 0.1从而使网络能够在不破坏预训练权重稳定性的前提下逐步融合姿态信号。4 渐进式跨域训练为了促进灵巧操作技能从人类先验向机器人载体的迁移采用一种两阶段训练范式。为弥合这两个训练阶段之间的人机载体差异将所有数据转换为成对的2D骨架RGB序列并在表1中展示各阶段的训练数据统计信息。阶段1以自我为中心的人类动作预训练。模型首先在大规模以自我为中心egocentric的人类视频数据集上进行训练。在此阶段DiT学习手与物体交互的基本动力学特性并建立从骨架构型到逼真视觉合成的映射关系。利用EgoDex (Hoque et al., 2025) 和 VITRA (Li et al., 2025c) 进行预训练。具体而言EgoDex数据被分割为81帧的片段。为了生成骨架引导信息将3D SE(3)手部姿态转换到相机坐标系并投影到2D空间以渲染包含双手及前臂的关节连线骨架视频。对于VITRA提取25帧的片段并利用其提供的动作标注MediaPipe格式的21个关节。利用相机内参及各片段首帧的相机位姿将这些关节投影为2D骨架视频以保持空间对应关系。阶段2机器人域适应。在成对的遥操作数据上对模型进行微调在该数据中人类手势通过逆运动学IK映射为机器人动作。这使得模型能够充当以机器人为中心的世界模型即由类人意图直接驱动机器人执行动作的视频生成。为了给RynnWorld-Teleop的训练提供必要的多样化物理交互数据收集一个专注于复杂双臂协同操作的大规模真实世界数据集。该数据集包含四项不同任务旨在挑战模型对物体动力学及长时程操作的理解能力。为了有效捕捉以人为中心的运动先验用动作捕捉MoCap系统记录操作者的手部动作从而获取同步的2D骨架序列。为确保与预训练阶段的时间一致性所有机器人轨迹均被分割为81帧的片段。这种基于骨架的统一表征结合一致的时间对齐促进了操作能力从人类演示到机器人载体的有效迁移。总共收集 1,800 个高质量的演示片段。与针对特定任务的策略训练不同这全部 1,800 个片段均被用于训练 RynnWorld-Teleop从而使生成模型能够从广泛的物理场景中学习到全面的世界先验知识。具体任务及其相应的数据分布详见表 2。5 自回归蒸馏为了支持交互式闭环应用将双向教师模型蒸馏为一个能够以帧为单位进行自回归视频生成的因果学生模型Huang et al., 2025。该过程包括针对流式推理重新配置模型随后进行两阶段优化因果流匹配causal flow-matching预热阶段和对抗性分布匹配阶段。因果流式架构。学生模型采用因果时间掩码和固定大小的 KV 缓存一种支持原地写入的预分配缓冲区以实现低延迟推理。与教师模型不同学生模型在时刻 t 的注意力仅限于 {1, . . . , t} 范围内的帧。为了在自回归生成过程中保持长期一致性将参考图像 I_ref 的嵌入embedding保留为持久的汇聚token并将所有后续生成的 KV 状态附加到缓存中。这种设计确保在整个生成过程中初始参考图像的身份特征和空间上下文得以保持。因果流匹配的预热。训练始于因果流匹配Lipman et al., 2022目标旨在弥合双向处理与因果处理之间的差距。通过最小化均方误差 L_MSE训练学生模型以帧因果的方式预测速度场 v_theta。该阶段利用单步速度回归建立学生模型的流式生成和遵循控制指令的能力为后续的采样加速提供稳定的初始化基础。分布匹配蒸馏。为了仅用四步去噪即实现高保真合成随后采用分布匹配蒸馏DMDYin et al., 2024。这一精细化过程利用学习的critic和冻结的教师模型提供基于分数的梯度引导从而将学生模型的输出分布推向教师模型的分布。在此阶段学生模型执行 4 步采样生成。关键在于在连续的数据块chunks之间通过持久化的 KV 缓存进行梯度反向传播。这种跨块的梯度流动促使模型最小化转换处的边界伪影确保时间上的平滑连续性并使最终模型能够在实时交互循环中达到与教师模型相当的视觉质量。RynnWorld-Teleop 如图3 所示是一个受动作驱动的以自我为中心egocentric的世界模型能够将手部姿态流转化为高保真的实时机器人视频。然而要实现数字遥操作的愿景仅靠世界模型是不够的它必须集成到一个闭环系统中该系统能够捕捉操作员意图、驱动生成器并产出可直接供下游策略使用的轨迹。下面使 RynnWorld-Teleop 成为此类数据引擎的配套系统1将操作员原始动作转化为用于模仿学习的视频、动作成对轨迹的端到端流程2将该范式与传统的物理仿真进行了对比其中阐述数字遥操作作为可扩展数据源的独特优势。1 策略学习的数据生成流水线为了实现可扩展的策略训练其开发了一套系统化的流水线利用 RynnWorld-Teleop 作为高保真数据引擎来生成合成的机器人轨迹。动作重定向Retargeting。基于佩戴在操作者胸部、手腕和上臂上的 Vive 追踪器所获取的原始 6 自由度6-DoF位姿首先通过一个经过校准的坐标变换链计算每只手臂末端执行器的目标位姿该变换链利用平移缩放因子将操作员的工作空间映射到机器人的工作空间。随后利用迭代阻尼最小二乘法DLS逆运动学求解器获取相应的关节配置求解过程中引入基于上臂追踪器推导出的零空间null-space肩部先验约束以确保手臂保持自然、类人的姿态。每次更新后都会强制执行关节限位约束。对于操作员的每一个动作该过程都会生成一个同步的 54 维机器人动作向量包含双臂各 7 自由度和双手各 20 自由度该向量与驱动 RynnWorld-Teleop 的手部位姿流精确对齐。基于骨架条件的合成。对于每一个源演示source demonstration提取初始 RGB 帧作为参考图像 I_ref。操作员的手部位姿流被渲染为以 16 FPS 采样的二维深度感知骨架序列 S_1:T。通过以 I_ref 和 S_1:T 为条件驱动 RynnWorld-Teleop合成相应的机器人执行视频。值得注意的是由于 I_ref 是目标场景的唯一视觉规范用户既可以直接提供该图像也可以对其进行合成编辑从而构建出超出训练分布范围的操作场景。无论采用哪种方式真实的机器人动作序列 a_1:T 均与生成的视频帧保持同步。每个动作 a_t 都是一个拼接向量包含双臂各 7 自由度和双手各 20 自由度的绝对关节位置信息。这些动作由原始遥操作过程中的操作者位姿重定向而来确保合成的视觉观测与机器人状态能够完美对齐从而满足下游模仿学习的需求。通过分块重锚定Chunked Re-anchoring缓解漂移。若完全采用自回归方式生成长时程视频往往会导致视觉漂移及累积性的物理不一致问题。为确保生成数据符合物理真实性采用一种基于分块的生成策略片段长度设定为 81 帧。对于首个片段模型利用演示数据的真实起始帧进行初始化而在后续的每个片段中通过引入机器人相机在特定时间步捕获的实际自我中心视角egocentric frame作为新的参考帧I_ref从而对生成过程进行重锚定。这种周期性的校准机制确保了在复杂长时程任务的整个过程中生成的环境如物体位姿和光照条件始终与真实动作序列保持一致。2 RynnWorld-Teleop 作为数据引擎与传统仿真技术的对比将 RynnWorld-Teleop 与传统物理仿真器进行对比以突显其作为可扩展数据引擎的优势无需 3D 资产构建传统仿真需要为每个物体显式创建 3D 网格mesh和 URDF 文件Guo et al., 2026; Zhao et al., 2025b。RynnWorld-Teleop 仅需单张参考图像 I_ref 即可隐式构建环境彻底规避人工资产建模的瓶颈。无视觉域差异仿真渲染固然存在“现实鸿沟”reality gapZhao et al., 2026b。RynnWorld-Teleop 直接在真实世界的像素分布空间内合成图像帧无需进行域随机化domain randomization即可自然地呈现复杂的光照、反射及传感器噪声。隐物理特性与人工系统辨识SysID的对比传统仿真器依赖繁琐的系统辨识过程如摩擦系数、质量参数的测定且难以处理可变形体。RynnWorld-Teleop 通过在大规模人类视频数据上进行预训练习得物理“常识”能够在无需显式微分方程的情况下生成符合物理规律的接触动力学效果。1 训练细节采用 Wan2.2-TI2V-5B (Wang et al., 2025a) 作为基础模型。为了使基础模型与目标环境的视觉特征如光照、特定物体相匹配首先进行标准的文本/图像生成视频TI2V微调作为预热阶段。该阶段不涉及动作条件控制。在 64 块 NVIDIA H100 GPU 上以 2 X 10-5的学习率对完整模型进行 2,000 步训练使模型能够适应人类与机器人数据集特有的视觉领域。动作条件训练。引入深度-觉察骨架条件控制分支并探索两种训练范式以适配模型低秩自适应LoRA和全参数监督微调SFT。这两种范式均遵循两阶段渐进式训练策略• 阶段 1以自我为中心的人类数据预训练用预训练的 Wan-2.2-TI2V-5B 主干网络初始化模型并在大规模人类数据集上学习基础的操作动力学。– 基于 LoRA优化 Patch Embedding 层和 LoRA 权重秩为 64学习率为 2 X 10-5。– 全参数 SFT以 2 X 10-5的学习率进行全参数微调并采用 200 步预热warmup及 EMA衰减率为 0.999以稳定交互先验的学习。• 阶段 2机器人域自适应在 1,800 个成对的人类-机器人交互片段episodes上对阶段 1 的检查点checkpoint进行微调以弥合具身差异。– 基于 LoRA继续训练 LoRA 权重和控制分支学习率为 1 X 10-5。– 全参数 SFT以 1 × 10⁻⁵ 的学习率微调模型的所有参数并结合 EMA衰减系数 0.999及 200 步预热warm-up策略以确保模型在复杂的双手动协同任务中的稳定性。自回归蒸馏。最后将双向教师模型转化为因果学生模型以实现实时推理• 因果流匹配Causal Flow-Matching预热学生模型以 1 × 10⁻⁵ 的学习率进行预热以建立时间上的因果关系。• 对抗蒸馏DMD针对少步交互式生成任务采用 DMD 方法其中生成器学习率为 2 × 10⁻⁶判别器学习率为 5 × 10⁻⁷。2 数字遥操作系统评估实验设置。实验在搭载双臂及双“无极”WUJI灵巧手的 TIANJI M6 移动机器人上进行。视觉数据流由安装在机器人视角的 RealSense D435i 摄像机采集。如图 4 所示为了展示方法在多种操作挑战中的泛化能力在四项需要不同程度双臂协作的任务上对该方法进行了评估(1) 双重抓取Dual Picking机器人利用左臂从盘中抓取苹果右臂抓取香蕉并依次将两个物体放置在桌面上。(2) 方块推动Block Pushing一项连续推动任务左臂先将一个大方块从左侧区域推至中心位置随后右臂接力将其推至指定的右侧目标区域。(3) 双臂提举Bimanual Lifting一项重载协作任务要求双臂同步将一个西瓜造型的毛绒玩具从桌面提起并准确放入托盘中。(4) 盖盖子Lid Placement一项侧重精度的任务要求机器人抓取盖子并将其准确对齐盖在纸箱上。这些任务综合考察了模型在双臂协同、时间序列规划及长程交互方面的能力。针对每项任务通过对初始环境状态进行大幅度随机化处理来评估模型的泛化性能这包括改变任务相关物体如水果、容器在工作空间坐标及轴向旋转方面的 6 自由度6-DoF位姿。主要的评估指标为成功率定义为每项任务在 35 次连续真实世界试验中的成功完成比例。若机器人能在 120 秒内达到目标状态则视为试验成功。基于生成式数据扩展的策略学习。除了视觉保真度外RynnWorld-Teleop 还充当了数字遥操作的生成式数据引擎它通过将不受约束的人类手势转化为与真实动作ground-truth actions完美同步的逼真执行轨迹从而扩展了机器人的训练数据集。特征分布分析。为了进一步探究真实世界机器人轨迹与 RynnWorld-Teleop 生成轨迹在视觉和语义上的对齐情况利用 t-SNE 进行特征分布分析。分别从真实世界演示数据集和 RynnWorld-Teleop 生成的数据集中随机抽取 1000 帧数据并使用预训练的 I3D 模型Carreira 和 Zisserman2017提取特征以捕捉高层语义信息。实时控制的延迟分析。为了验证 RynnWorld-Teleop因果型的实时性能在单块 NVIDIA H100 GPU 上评估了其端到端推理延迟。其采用 4 步流匹配flow matching调度进行优化的因果型蒸馏学生模型在 480 × 832 分辨率下实现了 40.0 fps 的高吞吐量。3 动作条件世界模型评估实验设置。为了全面评估 RynnWorld-Teleop 的生成能力设立两个不同的评估基准• EgoDex-Test以人为中心的领域为了评估通用交互先验并进行消融研究使用了 EgoDex 数据集Hoque 等人2025。从官方 EgoDex 测试集中随机抽取 50 个视频序列每个序列包含 81 帧帧率为 16 FPS。这些序列涵盖多种未见过的人与物体交互场景。使用这一具有代表性的子集能够确保无偏地评估模型将大规模人类操作先验迁移到动作条件生成任务中的效果。• Robotic-Test机器人专用领域为了评估模型在实际机器人载体和真实实验室环境中的表现预留一个特定的 Robotic-Test 集。该数据集包含 20 个视频序列每个序列 81 帧均从自行采集的遥操作数据中随机选出并确保这些数据未在第二阶段的机器人适应Robotic Adaptation训练中出现过。这些序列涵盖全部四类任务双臂抓取、方块推动、双臂提举和盖子放置旨在验证 RynnWorld-Teleop 能够在各种机器人操作场景中保持高视觉保真度和时间一致性。硬件基础设施如图10所示: 评估采用标准的机器人配置搭载 WUJI 灵巧手的双臂 TIANJI M6 系统。汇总包括自由度DoF、负载能力及指尖作用力在内的详细技术参数以确保该操作基准测试的可复现性。实体机器人基于TIANJI M6机械臂和WUJI灵巧手构建。策略的推理频率设定为50 Hz指令发送时的延迟保持在18到30毫秒之间。底层接口以500 Hz的频率运行确保了平滑的实时控制。控制策略与底层接口之间的通信通过LCMLightweight Communications and Marshalling实现。通过遥操作系统采集真实世界的演示数据。硬件配置包括一对TIANJI 7自由度机械臂和一对WUJI 20自由度灵巧手总计拥有54个自由度。在机械臂控制方面操作员佩戴五个HTC Vive追踪器分别安装在胸部、双腕和双上臂。系统以100-120 Hz的频率计算手腕相对于胸部的变换关系并将其输入到一个在独立进程中运行的、基于Pinocchio库的逆运动学求解器中。求解出的关节指令经由Ruckig轨迹生成器进行平滑处理考虑速度、加速度和加加速度约束随后以200 Hz的频率发送给机械臂。在灵巧手控制方面如图11所示操作员佩戴Manus数据手套。手套的原始信号被转换为MediaPipe的21点手部骨架格式并通过专用重定向模块映射到WUJI灵巧手的20自由度关节空间同时应用指数移动平均滤波器对运动进行平滑处理。CosHand。CosHand (Sudhakar et al., 2024) 是一种基于扩散模型的手部图像生成模型它根据参考图像和目标手部掩码mask来合成目标手部外观。其用其官方发布的模型检查点checkpoint并采用其基于图像条件的生成流程。对于每个视频提取第 0 帧作为参考图像并利用 SAM2 (Ravi et al., 2025) 从真实视频ground truth video中获取逐帧的二值手部分割掩码。在每个时间步 t 0以参考图像、参考手部掩码第 0 帧和目标手部掩码第 t 帧为条件使用 DDIM 采样50 步无分类器引导尺度为 1.5生成分辨率为 256 × 256 的目标帧。随后将生成的帧调整大小至 480 × 832 以匹配真实视频的分辨率从而为每个视频生成 81 帧帧率为 16 fps的视频。Mask2IV。Mask2IV (Li et al., 2026a) 是一种两阶段潜空间视频扩散模型它根据输入图像、文本提示prompt以及起始和结束手部掩码来生成视频。用该模型两个阶段的官方发布检查点。对于每个真实视频提取 SAM2 (Ravi et al., 2025) 手部掩码并将 81 帧的序列划分为 5 个互不重叠的片段chunk每个片段包含 16 帧。对于片段 i其生成条件包括索引为 16i 的真实帧作为输入图像、第 16i 帧起始和第 16(i 1) 帧结束的手部掩码以及基于任务名称生成的文本提示例如“一只手正在倒东西”。推理过程在 320 × 512 分辨率下进行采用 50 步 DDIM 采样、η 1.0、无分类器引导尺度 1.0 以及引导重缩放guidance rescale0.7。将这 5 个片段按顺序拼接形成 80 帧的输出视频最后将其调整大小至 480 × 832 以进行评估。InterDyn。InterDyn (Akkerman et al., 2025) 在 Stable Video Diffusion (SVD) 的基础上增加一个 ControlNet 分支该分支接收手部交互掩码作为空间条件输入。通过帧重采样将每段真值ground truth视频从 16 fps 转换为 12 fps并将其分割为两个互不重叠、各包含 28 帧的片段。相应的 SAM2 (Ravi et al., 2025) 手部掩码也经过同样的重采样处理并转换为 InterDyn 输入流水线要求的 VP9 编码 WebM 格式。对于每个片段InterDyn 将第一帧作为参考图像将 28 帧的掩码序列作为 ControlNet 条件在 50 步去噪过程中生成 14 帧输出时间维度下采样因子为 2帧率为 6 fps。这两个片段共生成 28 帧预测图像原始分辨率为 256 × 384随后将其上采样至 480 × 832以便与真值进行指标计算。