公司动态

盘点|RSS 2026首位国人「青年成就奖」得主,李弘扬团队2026年最新研究成果

📅 2026/8/14 11:32:01
盘点|RSS 2026首位国人「青年成就奖」得主,李弘扬团队2026年最新研究成果
「从看懂世界到与世界互动」目录01 自动驾驶、场景生成与三维感知1. 优化引导的交互式场景生成扩散模型2. 世界引擎迈向自动驾驶后训练时代3. PlannerRFT通过闭环和样本高效微调强化扩散规划器CVPR 264. SimScale通过大规模真实世界模拟学习驾驶CVPR 265. 测试时修正一种通过视觉提示的在线 3D 检测系统T-PAMI 266. LatentVLA从视觉-语言模型中学习未来感知的潜在表征用于自动驾驶02 机器人学习、操作与触觉数据7. RISE基于组合世界型的自改进机器人策略RSS 268. NativeMEM用于长周期机器人操作的原生内存压缩9. FreeTacMan用于接触式操作的无机器人视觉触觉数据采集系统10. TAMEn用于接触密集型任务闭环数据收集的触觉感知操作引擎11. 可扩展机器人操作中多样性是否为关键要素T-RO 2603 人形机器人、运动控制与具身导航12. RoboNaldo通过运动引导的课程强化学习实现人形机器人足球射门的精准、稳定与强大13. 敏捷性与稳定性兼备基于异构数据的多功能人形机器人控制ICRA 2614. WholeBodyVLA迈向全身运动操作控制的统一潜变量视觉-语言-动作模型ICLR 2615. 稀疏视频生成推动真实世界超视距视觉-语言导航04 写在最后2026年7月RSS 2026将青年成就奖颁给了香港大学助理教授李弘扬。李弘扬成为这一荣誉设立22年来首位获奖的国人学者。从自动驾驶领域到具身智能从2022年百强影响力AI论文BEVFormer、CVPR 2023最佳论文UniAD近十年来大陆学术机构唯一获此奖项的工作再到具身百万真机数据集AgiBot World、创立源策未来并明确提出全身智能WBI的技术方向。从看懂世界到与世界互动李弘扬团队OpenDriveLab2026年的15篇代表性工作正是这条轨迹的最新截面。下文按三个方向逐一拆解。01 自动驾驶、场景生成与三维感知1. 优化引导的交互式场景生成扩散模型图 1OMEGA 在扩散生成过程中注入交互约束以生成更符合物理与行为逻辑的安全关键场景。论文标题Optimization-Guided Diffusion for Interactive Scene Generation论文介绍自动驾驶评估中现实多样的多智能体驾驶场景至关重要。然而现有数据集中安全关键事件稀少且代表性不足而现有模型生成的场景往往缺乏可控性或容易生成违反物理与社会约束的样本。OMEGA 提出了一个优化引导的无训练框架。该方法通过约束优化重新锚定每个逆扩散步骤确保扩散模型在场景生成过程中保持结构一致性和交互感知。特别是它将自我—对手交互建模为分布空间中的博弈论优化从而能够生成逼真且安全关键的对抗性场景。实际测试中OMEGA 能够大幅提升生成场景的物理合理性与可控性。它不仅能让生成的车辆行为更符合现实逻辑还能高效“导演”出大量极具挑战性的近碰撞危险场景为自动驾驶系统的压力测试提供了丰富的素材。论文链接https://arxiv.org/pdf/2512.076612. 世界引擎迈向自动驾驶后训练时代图 2World Engine 从真实驾驶日志重建交互环境生成安全关键变体并用于策略后训练。论文标题World Engine: Towards the Era of Post-Training for Autonomous Driving论文介绍现代端到端驾驶策略在常规场景中表现出色但其可靠性严重受限于真实驾驶数据集中安全关键“长尾”事件的稀缺性。单纯扩展预训练数据在应对这些罕见事件时往往收益递减。论文提出了 World Engine 生成式框架能够从真实世界日志中重建高保真交互环境并系统地推断出逼真的安全关键变体。该范式通过基于强化学习的后训练使策略与安全约束对齐从而规避了在真实世界中进行安全探索固有的物理风险。在公共基准测试中这种“在脑海中演练危险”的后训练方式让自动驾驶策略在面对罕见的危急情况时更加从容其带来的安全收益远超单纯堆砌常规的预训练数据。论文链接https://arxiv.org/pdf/2606.19836延伸解读港大华为开源World Engine加塞碰撞降45.5%、200km零接管3. PlannerRFT通过闭环和样本高效微调强化扩散规划器CVPR 26图 3PlannerRFT 同时优化轨迹分布与去噪引导使扩散规划器能在闭环中进行更高效的探索。论文标题PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning论文介绍扩散模型在生成自动驾驶轨迹时往往难以产生多模态且自适应场景的结果。同时在微调过程中这些规划器对信息奖励的利用效率低下容易导致模式崩溃。PlannerRFT 提出了一种双分支优化方法在微调扩散规划器时同时优化轨迹分布并自适应地引导去噪过程以实现更有效的探索。为了支持这种强化微调团队还开发了 nuMax 模拟器其速度比 nuPlan 快 10 倍能够支持大规模并行闭环学习。经过这种闭环强化微调后扩散规划器不仅能构思出多种合理的行驶路线还能在面对复杂路况时做出更敏捷、更可靠的规划决策。论文链接https://arxiv.org/pdf/2601.129014. SimScale通过大规模真实世界模拟学习驾驶CVPR 26图 4SimScale 从真实驾驶日志合成未见状态并通过伪专家轨迹为驾驶策略提供监督。论文标题SimScale: Learning to Drive via Real-World Simulation at Scale论文介绍实现完全自动驾驶系统需要学习在各种场景下的合理决策但安全关键和分布外场景在真实世界数据中代表性不足单纯收集真实数据难以覆盖所有边界情况。本文引入了一个新颖且可扩展的模拟框架 SimScale能够基于现有驾驶日志合成大量未见状态。该框架利用先进的神经渲染和反应式环境生成高保真多视角观测并开发了伪专家轨迹生成机制为端到端模型提供动作监督。在真实世界的基准测试中得益于这种大规模的虚拟数据“喂养”自动驾驶模型在应对困难导航场景时的表现获得了显著提升。论文链接https://arxiv.org/pdf/2511.233695. 测试时修正一种通过视觉提示的在线 3D 检测系统T-PAMI 26图 5TTC 利用视觉提示驱动在线适配器并通过提示缓冲区持续修正三维检测结果。论文标题Test-time Correction: An Online 3D Detection System via Visual Prompting论文介绍传统的离线 3D 检测器在推理时无法在线纠正错误导致自动驾驶系统在面对新场景或分布偏移时适应性差存在将错误传递给下游规划模块的风险。本文提出了测试时修正TTC系统通过为现有 3D 检测器配备即插即用的在线适配器OA模块实现实时错误纠正。OA 模块利用视觉提示如来自 2D 检测、道路描述或用户点击的辅助反馈生成查询并维护一个视觉提示缓冲区以实现连续修正。TTC 系统就像给自动驾驶感知模块配了一个“在线纠错员”。它完全不需要重新训练庞大的主干网络就能在车辆行驶过程中实时发现并修正漏检或误检让模型在面对从未见过的陌生场景时依然稳健。论文链接https://arxiv.org/pdf/2412.07768v36. LatentVLA从视觉-语言模型中学习未来感知的潜在表征用于自动驾驶图 6FLARE 以未来特征预测激活视觉语言模型的潜在表征并将其用于驾驶规划。论文标题LatentVLA: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving论文介绍当前自动驾驶方法过度依赖劳动密集型的语言标注来连接感知与控制导致离散语言与连续驾驶轨迹不匹配影响了控制策略的平滑性和预训练知识的利用效率。FLARE或 LatentVLA框架通过自监督未来特征预测目标在无需语言监督的情况下激活预训练视觉-语言模型VLM的视觉语义能力。该机制促使模型直接在潜在空间中预测场景动态和自车运动从而从大规模未标注轨迹数据中学习鲁棒的驾驶表征。此外团队还将群组相对策略优化GRPO整合到规划过程中以提升决策质量。测试表明通过这种自监督方式“榨取”出的视觉语言模型潜力让自动驾驶的规划能力达到了全新的水平。论文链接https://arxiv.org/pdf/2601.0561102 机器人学习、操作与触觉数据7. RISE基于组合世界型的自改进机器人策略RSS 26图 7RISE 以组合世界模型预测未来状态并通过价值评估为策略改进提供闭环信号。论文标题RISE: Self-Improving Robot Policy with Compositional World Model论文介绍视觉-语言-动作VLA模型在接触密集和动态操作任务中表现脆弱由于缺乏闭环反馈微小的执行偏差往往会导致任务彻底失败。RISE 提出了一个可扩展的机器人强化学习框架其核心是组合世界模型。该模型通过可控动态模型预测多视角未来并用进度价值模型评估想象结果。这种想象驱动的评估机制为策略改进提供了闭环信号使机器人在无需密集真实交互的情况下实现自我提升。在诸如动态砖块分类、背包打包等真实世界的复杂任务中这种基于想象的自我反思机制让机器人的操作成功率获得了跨越式的提升。论文链接https://arxiv.org/pdf/2602.110758. NativeMEM用于长周期机器人操作的原生内存压缩图 8NativeMEM 将长时视觉历史压缩为紧凑记忆 token使预训练 VLA 可在低开销下利用历史信息。论文标题NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation论文介绍预训练视觉-语言-动作模型VLA在处理长周期机器人操作时面临如何在保持推理效率的同时有效保留长时视觉历史的挑战。NativeMEM 提出了一种高效的内存编码方案它复用 VLA 自身的视觉编码器将每个历史帧压缩为单个记忆 token。这些紧凑的记忆 token 使预训练 VLA 能够以极低的开销处理长期历史无需依赖外部规划器或重新初始化的记忆模块。得益于这种高效的记忆压缩技术机器人在执行长步骤任务时不再“健忘”成功率实现了翻倍式的增长而且几乎没有增加额外的计算和内存负担。论文链接https://arxiv.org/pdf/2607.066789. FreeTacMan用于接触式操作的无机器人视觉触觉数据采集系统图 9FreeTacMan 通过可穿戴视觉触觉夹持器与光学追踪系统采集接触密集操作数据。论文标题FreeTacMan: Robot-free Visuo-Tactile Data Collection System for Contact-rich Manipulation论文介绍机器人在接触密集型操作中的学习主要受限于数据收集效率低下和传感器设置不足传统的遥操作数据往往缺乏高质量的触觉反馈。FreeTacMan 提出了一个以人为中心、无机器人的数据采集系统。该系统设计了一个可穿戴的、带有视觉触觉传感器的夹持器可由人手佩戴进行直观控制并通过高精度光学跟踪系统同步捕获末端执行器姿态及多模态反馈从而高效收集高质量操作数据。测试结果显示用这套系统收集的带有丰富触觉反馈的数据能够极大地帮助机器人掌握接触密集型技能相比于只靠“看”的纯视觉方法机器人的操作成功率有了质的飞跃。论文链接https://arxiv.org/pdf/2506.0194110. TAMEn用于接触密集型任务闭环数据收集的触觉感知操作引擎图 10TAMEn 将跨形态可穿戴界面、视觉触觉数据和人机协作恢复数据连接为闭环采集管线。论文标题TAMEn: Tactile-Aware Manipulation Engine for Closed-Loop Data Collection in Contact-Rich Tasks论文介绍现有手持数据采集范式在接触密集型双臂操作中面临硬件适应性、数据效率以及交互式恢复数据收集困难的挑战。TAMEn 是一个触觉感知操作引擎通过跨形态可穿戴界面实现异构夹持器的快速适应。它采用双模态数据采集管线结合运动捕捉和 VR 追踪并整合大规模触觉预训练、双臂演示和人机协作恢复数据以实现闭环策略优化。这套触觉感知操作引擎彻底打通了双臂协同任务的数据瓶颈。有了它采集的高质量闭环数据机器人在面对复杂双臂操作时的成功率得到了大幅改善。论文链接https://arxiv.org/pdf/2604.0733511. 可扩展机器人操作中多样性是否为关键要素T-RO 26图 11GO-1-Pro 从任务、实体和专家三类多样性分析机器人数据扩展并通过分布去偏提高数据效用。论文标题Is Diversity All You Need for Scalable Robotic Manipulation?论文介绍在机器人操作领域有效数据扩展的原则尚不明确尤其是“数据多样性”对模型泛化能力的具体贡献和潜在负面影响缺乏系统分析。该研究GO-1-Pro通过分析任务、具身实体和专家三个维度的数据多样性探讨其在机器人学习中的作用。研究发现专家数据的多样性会导致速度多模态性即同一任务存在不同速度的演示从而混淆策略学习。为此论文提出了一种分布去偏方法来缓解这种模糊性。应用这种分布去偏方法后机器人操作模型就像被“打通了任督二脉”其带来的性能飞跃甚至相当于凭空多“喂”了两倍半的预训练数据。论文链接https://arxiv.org/pdf/2507.0621903 人形机器人、运动控制与具身导航12. RoboNaldo通过运动引导的课程强化学习实现人形机器人足球射门的精准、稳定与强大图 12RoboNaldo 从稳定踢球先验出发逐步学习任意球适应与移动球射门。论文标题RoboNaldo: Accurate, Stable and Powerful Humanoid Soccer Shooting via Motion-Guided Curriculum Reinforcement Learning论文介绍现有方法难以使人形机器人在足球射门中同时具备稳定性、高冲击力和准确性尤其是在适应不同球位、移动球和击球时机方面存在极大挑战。RoboNaldo 提出了一个三阶段运动引导的课程强化学习框架。首先学习稳定的全身踢球先验然后适应任意位置的静止球任意球设置最后通过高层运动指令和踢球触发接口将能力扩展到复杂的移动球射门。通过这种循序渐进的课程学习人形机器人在模拟足球场上展现出了惊人的运动天赋不仅射门精度大幅提高踢球的力量和速度也远超现有的常规控制方法。论文链接https://arxiv.org/pdf/2606.1109213. 敏捷性与稳定性兼备基于异构数据的多功能人形机器人控制ICRA 26图 13AMS 将动作捕捉与物理约束合成数据结合统一训练动态技能与极限平衡行为。论文标题Agility Meets Stability: Versatile Humanoid Control with Heterogeneous Data论文介绍在人形机器人控制中现有方法要么专注于敏捷动态技能要么专注于稳定性关键行为很难在单一策略中兼顾这两者。AMS 框架通过结合人类运动捕捉数据集和物理约束的合成平衡运动数据统一了动态运动跟踪和极限平衡维护。该方法设计了混合奖励机制和自适应学习策略以有效训练涵盖极端平衡与高机动性的多样化运动分布。得益于这种异构数据的融合训练研究人员成功在一个策略下让人形机器人变成了“全能选手”它不仅能像运动员一样奔跑跳舞还能稳稳地做出“叶问蹲”、单腿站立等挑战极限平衡的动作。论文链接https://arxiv.org/pdf/2511.1737314. WholeBodyVLA迈向全身运动操作控制的统一潜变量视觉-语言-动作模型ICLR 26图 14WholeBodyVLA 从人类视频中学习统一潜变量监督并通过 LMO-RL 策略执行稳定的全身运动操作。论文标题WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control论文介绍现有的人形机器人方法在操作感知型运动方面存在不足往往将移动与操作割裂导致机器人工作空间受限无法进行大范围的全身运动操作。WholeBodyVLA 提出了一个统一的潜变量学习框架使视觉-语言-动作VLA系统能从低成本的无动作自我中心视频中学习。它不仅设计了高效的数据收集流程来扩充数据集还引入了面向运动操作的强化学习LMO RL策略以将潜动作准确解码为底层控制指令。在真实的人形机器人上这套统一潜变量框架彻底打破了“边走边做”的瓶颈让机器人在执行大范围、跨区域的全身运动操作时显得更加游刃有余。论文链接https://arxiv.org/pdf/2512.1104715. 稀疏视频生成推动真实世界超视距视觉-语言导航图 15SparseVideoNav 生成稀疏未来帧将视频生成模型的长时信息用于超视距导航推理。论文标题Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation论文介绍现有的视觉-语言导航方法过度依赖详细的语言指令难以在真实世界中实现自主导航尤其是在超出当前视野BVN的长周期任务中。SparseVideoNav 首次将视频生成模型引入超视距导航任务利用其长时序监督的优势来对齐语言指令。为解决视频生成的高延迟问题该方法通过生成 20 秒稀疏未来帧在保证长时规划能力的同时实现了亚秒级的轨迹推理。在真实世界的复杂环境中这种具备“预见未来”能力的导航系统展现出了压倒性的优势。它不仅能更准地找到视距外的目标甚至在极具挑战的夜间场景中也首次实现了可靠的自主导航。论文链接https://arxiv.org/pdf/2602.0582704 写在最后李弘扬在悉尼的获奖演讲里讲了一个很有意思的观点。他说大部分人都不太看好全身智能觉得很难。更多人想的是一条更安全的路先把灵巧手做好或者先把底盘控制做稳等条件成熟了再去谈全身协调。这些想法都有道理但他不打算等。真正重要的问题往往在一开始都不是主流。从2026年这15篇工作的分布来看他确实在用行动兑现不等待当真实世界的数据不够用就合成它当采集数据的工具不够好就造工具当单一技能不够用就打通全身协调。每一步都在回答智能体如何在不完美的世界里自我进化。