公司动态
Science Robotics 7月封面 | 仅靠机载设备,用一套强化学习跑出野外6m/s极限越障
跑步机上的6m/s是旧闻野外的6m/s是封面新闻——区别是目录01 现有四足运动控制三条技术路线固有短板基于模型的控制MPC/零力矩点等无模型原始强化学习运动先验类模仿学习AMP、分层HRL02 APT-RL核心三层架构拆解简化2D轨迹优化低成本生成百万级运动数据集Transformer变分自编码器TVAE统一隐空间表征辅助动作补偿机制补齐2D数据与真实3D环境差距感知蒸馏仿真高程图迁移至机载相机激光雷达03 多场景真机实测指标真实价值与客观边界室内障碍场景1.1km城市校园长距离导航0.34km森林野外地貌横向对标主流运动框架04 整套方案落地价值与不可忽视的局限工程落地核心收益当前方案客观短板05 行业影响与未来拓展方向在四足机器人领域高速6m/s本身并不稀奇。早几年的MIT Cheetah 在跑步机上盲跑就能达到这个速度。但那些“高速”通常依赖外部动捕系统Vicon天花板布满红外摄像头实时告诉机器人“你在哪”。运动先验轨迹在平地上预先算好落脚点闭着眼跑。但跑步机上的高速终究是“温室里的速度”。一旦进入无结构化的真实野外环境会严重制约四足机器人高速通行步态切换失稳、多技能训练样本昂贵、离不开外部动捕三大难题限制足式机器人落地。韩国KAIST团队发布的最新研究APT-RLAction Pretrained Transformer-based Reinforcement Learning统一强化学习框架登上Science Robotics7月最新封面。依托轨迹优化预训练Transformer表征单套机载策略即可自主切换小跑、奔跳两种核心步态室内60cm高台瞬时峰值速度4.25m三级台阶下落冲击前瞬时速度达6m/s创造真实野外感知运动弗劳德数7.69的行业新基准自然界四足动物从小跑切换到奔跳的弗劳德数阈值大约在 2 到 3 之间。01 现有四足运动控制三条技术路线固有短板想要看懂APT-RL的创新逻辑我们先拆解当下主流四足控制方案各自无法规避的工程缺陷。基于模型的控制MPC/零力矩点等依靠刚体动力学、接触力方程搭建显式物理模型理论稳定性可控但现实中地面摩擦、足部接触、机身形变等非线性因素难以精准建模。一旦遇到树根、碎石等不规则地形模型预测偏差会急剧放大仅能支持1m/s以内低速越障无法实现高速跳跃、跌落等高动态动作适用场景局限于平整人工路面。无模型原始强化学习不依赖动力学先验直接从交互中学习控制策略但样本需求巨大且单策略难以兼容多种步态。若同时适配小跑、奔跳、攀爬等动作训练难度会指数级上升绝大多数原始RL方案只能针对单一地形、单一速度优化高速与复杂障碍场景无法兼顾。即便增加奖励函数约束真实环境泛化能力依旧薄弱。运动先验类模仿学习AMP、分层HRLAMP依靠动物动捕或优化轨迹模仿运动但大规模地形适配的动捕数据采集成本极高且模型仅能复刻参考动作遇到陌生障碍物自适应能力差分层强化学习HRL将不同障碍对应独立专家策略切换时容易出现动作断层且每个技能都要单独训练新增障碍场景需要重新迭代同时多数方案依赖外部动捕定位脱离实验室环境直接失效。▲KAIST HOUND四足机器人室内外全场景运动实测图上述三类方案均无法同时达成「多步态平滑切换、野外纯机载感知、高速高动态动作、低样本训练成本」四大落地要求。APT-RL采用「轨迹优化预训练Transformer隐空间表征感知蒸馏」三段式架构针对性补齐现有路线短板从数据生成、表征学习、真机迁移全链路优化。02 APT-RL核心三层架构拆解整套框架分为轨迹优化数据生成、表征强化学习、感知蒸馏部署三大阶段全部流程在仿真内完成预训练后零迁移至KAIST HOUND 45kg实物四足网络设计兼顾训练效率与机载实时推理需求。▲APT-RL完整三阶段训练流水线示意图简化2D轨迹优化低成本生成百万级运动数据集以往运动先验方案要么依赖昂贵动物动捕要么在线优化轨迹造成算力开销爆炸。APT-RL使用单刚体2D Sagittal平面动力学模型做轨迹优化SRBD仅约束机身高度、俯仰角、足地接触时序核心参数大幅降低求解复杂度。核心优化逻辑基于冲量守恒方程约束单周期步态前后机身速度、高度连续性公式仅保留核心物理关系复杂推导省略该公式代表前后腿地面反作用力对机身水平速度的周期约束通过贝塞尔曲线拟合接触力快速生成周期性小跑、奔跳轨迹。整套优化流程效率极高8分钟即可生成合计15.5小时、18万条运动样本每条轨迹同步输出机身状态与对应关节扭矩不用额外拟合控制指令。▲五种步态多地形性能对比雷达图研究对比了小跑、奔跳、对角溜步、疾驰、弹跳五种步态在台阶、高台、乱石、踏石地形的成功率、速度跟踪、运输成本COT三大指标。综合来看小跑低速稳定性强、能耗更低奔跳在高台、大落差障碍下通过率遥遥领先其余步态仅在特定单一地形具备微弱优势通用性不足因此APT-RL选定二者作为基础步态原语。Transformer变分自编码器TVAE统一隐空间表征这是APT-RL区别于AMP、HRL的核心创新。传统模仿学习只能跟踪固定参考轨迹该框架用TVAE将所有小跑、奔跳运动编码至共享16维隐空间训练分为两步第一步状态编码器预训练输入连续3帧本体感知信息机身速度、足高、关节角度等共69维数据通过Transformer自监督重构时序状态KL正则约束隐空间服从标准高斯分布保证表征平滑连续第二步步态专用扭矩解码器冻结共享编码器分别训练小跑、奔跳两套解码器输入隐向量直接输出12维关节扭矩省去额外轨迹跟踪RL阶段传统方案普遍需要二次强化学习适配扭矩输出。▲隐空间PCA与t-SNE可视化图从可视化结果能直观看到仅用2D平地数据训练的隐空间在真实3D山林、台阶场景下会自动拓展出新表征区域面对树根、高落差等未出现在训练集的障碍时模型能自主生成全新运动模式。辅助动作补偿机制补齐2D数据与真实3D环境差距2D轨迹优化数据仅覆盖机身前后运动缺少侧摆、扭转三维动作仅靠解码器扭矩无法应对真实地形扰动、机身故障等极端工况。因此策略输出分为两部分隐动作扭矩TVAE解码器输出基础周期运动扭矩承担80%以上基础步态驱动力辅助动作12维PD修正量专门补偿侧摆髋关节扭矩、落地冲击修正、腿部受损后的轨迹重规划。▲不同场景扭矩分解曲线图原木跳跃、单腿故障、原地转向三组实测扭矩曲线清晰证明常规平地直行时辅助扭矩占比极低面对未见过的跳跃障碍、机身失效、转向动作时辅助扭矩会大幅提升弥补预训练数据缺失的三维运动维度。消融实验证明移除辅助动作后高台阶地形任务成功率从94.6%暴跌至2.9%该模块是虚实迁移的关键支撑。感知蒸馏仿真高程图迁移至机载相机激光雷达仿真训练阶段策略依靠完整地形高程图作为感知输入但真机仅搭载RealSense D435深度相机、Hokuyo 2D激光雷达无法获取全局高程信息。论文采用师生蒸馏方案教师编码器以仿真2.5D高程图为输入输出32维地形隐特征学生CNN-GRU编码器输入深度图像、45维激光点云学习复刻教师输出的地形表征真机推理完全抛弃高程图仅依靠机载视觉雷达。▲多传感器消融柱状图通过传感器对比实验单独深度相机近距离障碍识别精准但探测距离不足单独激光雷达远距离地形感知稳定缺少局部精细轮廓二者融合后全地形任务成功率提升15%~40%。硬件配套层面团队定制3D打印弹簧减振支架将高速跳跃下10g以上冲击对激光雷达的干扰大幅降低解决高动态运动中传感器失效痛点。03 多场景真机实测指标真实价值与客观边界实验分为室内障碍、城市校园、野外森林三大真实场景。▲三类场景自主导航轨迹与步态选择时序图室内障碍场景60cm高台跳跃实验瞬时峰值4.25m/s90cm台阶下落峰值6m/s策略会根据障碍高度自主切换步态低于20cm台阶采用低速小跑2m/s高于40cm高台自动切换奔跳步态切换频率2Hz单次锁定0.5秒动作过渡无卡顿。指标局限室内地面平整、无打滑、树根等随机扰动6m/s峰值仅为落地前瞬时速度无法长时间维持高速持续行进。1.1km城市校园长距离导航覆盖多层台阶、坡道、草坪混合地形全程无人工干预。低速上下楼梯选用小跑保证稳定高速跨越台阶自动切换奔跳整套策略仅一套权重不用分场景切换模型。长距离实验证明框架不存在累积漂移连续十多分钟自主行走无倾覆。0.34km森林野外地貌包含倒伏树干、裸露树根、凹凸泥土、湿滑落叶机器人自主选择奔跳翻越原木凹凸地面切换小跑降低冲击。野外场景最能体现方案泛化能力训练数据集完全无树干、不规则土坡样本依靠隐空间拓展与辅助扭矩完成自适应调整。▲动态步态切换鲁棒性热力图横向对标主流运动框架研究将APT-RL与AMP、残差分层HRL、原始无模型RL三类主流方案做全维度消融对比对比AMP同等仿真数据集下APT-RL所有地形运输成本1/COT更高能耗更优AMP过度拟合参考轨迹陌生障碍通过率大幅下滑对比残差HRL相同训练样本量下APT速度跟踪奖励提升20%以上随机2Hz高频步态切换时HRL极易失衡摔倒本方案切换成功率提升一倍以上消融实验证明三大模块缺一不可共享隐空间、辅助动作、TVAE预训练任意一项移除复杂地形任务成功率直接腰斩。04 整套方案落地价值与不可忽视的局限工程落地核心收益数据成本大幅降低无需动捕、大量真机试飞仅依靠8分钟仿真生成的2D轨迹数据集完成预训练大幅减少硬件损耗与野外测试风险纯机载自主部署摆脱动捕、室外定位基站仅深度相机激光雷达即可完成全地形自主运动适配野外搜救、山林巡检等无基础设施场景单一通用策略不用为台阶、原木、沟壑单独训练专用子策略一套权重兼容高低速、多类障碍产线多机型迭代成本更低硬件容错能力辅助扭矩可补偿腿部临时故障、传感器振动干扰极端工况生存能力优于传统控制方案。当前方案客观短板步态种类受限当前仅支持小跑、奔跳两类步态窄空间侧身、匍匐、急转等特殊动作未纳入狭小废墟搜救场景适配不足感知仅依赖几何信息无语义识别无法区分人、岩石、树枝不能实现目标导向自主规划仅能完成地形越障不具备任务级智能运动平面偏向前后向侧向敏捷性不足高速横向闪避、急转弯性能较弱仅适用于沿路径直行巡检仿真环境仍存在域间隙极端强湿滑、碎石滑坡等地质场景仿真数据覆盖不足真机易出现打滑失衡机型绑定特性当前基于KAIST HOUND大负载四足开发小型轻量化足式机器人直接迁移需要重新优化动力学与解码器。05 行业影响与未来拓展方向现阶段四足机器人商业化落地最大阻碍就是野外复杂环境高速自主通行能力不足多数工业机型仅能在园区平整道路低速巡逻。APT-RL给出一套完整「仿真预训练-感知蒸馏-真机零样本部署」全栈管线平衡训练成本、运动敏捷性与机载硬件算力约束相比分层RL、AMP等路线综合工程优势明显。整体来看APT-RL通过2D轻量化轨迹预训练共享Transformer隐表征感知蒸馏的组合创新为野外高动态四足机器人提供了一条可复制、低成本的技术路线。参考论文论文标题Agile perceptive multi-skill locomotion for quadrupedal robots in the wild