公司动态
π0.5:VLA模型开放世界泛化的突破与实践
如果你最近在关注具身智能大概率见过这类画面机械臂在演示环境里稳稳抓杯、倒水、叠衣动作流畅得像一个训练有素的助手。但真实情况往往没有视频里那么美好——同一个 VLA 模型换一盏灯、换一块桌面、换一件训练集里没见过的物体成功率可能立刻崩盘。这种“演示即巅峰”的现象正是当前视觉-语言-行动VLA模型最尴尬的短板。π0.5 这组工作想解决的恰恰就是这个问题。从论文题目里的关键词可以看出它瞄准的是“开放世界概括”让 VLA 模型在从未见过的物体、场景和指令组合下仍然能够完成物理操作。翻译成人话模型不能只会背题得学会在“没见过的卷子”上答题。先亮明这篇文章的主判断VLA 模型的瓶颈从来不是单纯的网络结构而是数据、动作表达、评测方式三者之间的不匹配。π0.5 真正的价值不在于刷高了多少个评测点而在于把“开放世界泛化”从一个口号变成了可以研究、可以评测、可以迭代的工程问题。理解这一点比记住任何模型参数都重要。下面我从问题拆解、模型机制、评测现实、仿真定位、学习路线五个维度展开。1. 为什么“能跑通演示”不等于“能处理开放世界”1.1 一个典型的翻车现场我在接触具身智能项目的过程中反复见到同一种场景。某个团队在 MuJoCo 或 Isaac Sim 里训练机械臂抓取动作仿真环境里成功率刷到了 95%。于是他们把模型部署到真实机械臂上打算复现同样的动作。结果一开机就发现三个问题真实的相机曝光和仿真渲染不一样机械臂的关节响应延迟比仿真中大不少桌面上哪怕多放一包没见过的纸巾模型就可能给出一个离谱的抓取姿态。这不是个例。很多入门者把 VLA 模型在模拟器里的成功率直接等同于真实场景里的可用性结果都被现实教育了一轮。为什么会有这种落差核心原因在于VLA 模型的训练目标通常是“根据当前图像和语言指令输出下一步动作”。在训练分布内模型可以靠记忆和插值完成任务一旦输入偏离训练分布比如物体形状变化、光照变化、相机视角变化、背景杂物干扰模型就会失去方向。这里的本质问题是模型学到的是统计相关性而不是物理因果。1.2 开放世界概括到底指什么在具身智能语境里“开放世界概括”通常包含四层含义物体层面的泛化训练时见过陶瓷杯测试时换成玻璃杯、纸杯或者一个造型奇怪的杯子模型还能不能抓场景层面的泛化训练环境是干净的实验桌面测试环境是堆满杂物的真实厨房模型还能不能定位目标指令层面的泛化训练时听过“把杯子放到盘子里”测试时换成“拿起杯子走到桌角再放下”模型能不能理解这种组合语义动作层面的泛化训练时只见过固定轨迹测试时目标物体偏移了 10 厘米模型能不能实时调整抓取姿态这四层里物体和场景的泛化主要靠数据多样性指令泛化靠语言模型的理解能力动作泛化则要靠动作生成策略的鲁棒性。π0.5 要同时面对这四层难点在于它们彼此耦合目标物体变了抓取动作要跟着变指令换了整个任务规划都要重排。所以更准确地说π0.5 是一次“组合泛化”的尝试。它不是在单一任务上做端到端拟合而是在搭建一个跨任务、跨场景的动作生成基础能力。1.3 泛化是系统问题不是调参能解决的很多初学者觉得泛化不好就加数据、调模型、换损失函数。但实际上开放世界概括更像一个系统设计问题你需要设计合适的数据采集流程、合适的动作表达方式、合适的训练目标、合适的评测基准。这四个环节只要有一个掉链子模型在开放场景里的表现就会大打折扣。提醒单次跑通只能说明流程没有断。真正检验模型水平的是连续多次测试的成功率、失败模式分布以及面对环境扰动时的恢复能力。这也是这篇文章反复强调的一个判断不要把 VLA 看作“一个模型”要把它看作“一条从数据到动作的流水线”。π0.5 这类工作的意义正是在流水线的多个环节上同时动手。2. VLA 模型内部机制它到底由哪几块拼图组成2.1 三段式架构视觉编码器、语言底座、动作头要理解 π0.5 的定位得先说清 VLA 模型的基本骨架。一个典型的 VLA 模型由三部分组成视觉编码器把相机图像转换成特征向量。常见的有 ViT、SigLIP 这类预训练视觉模型负责提取物体的形状、位置、纹理等信息。语言模型底座把自然语言指令编码成任务语义并通过交叉注意力与视觉特征融合。这一步相当于在“大脑”里做推理理解用户到底想干什么。动作头把融合后的特征映射为具体的动作输出。动作形式可以是末端位姿增量、关节角度也可以是离散的动作 token。三者的配合逻辑是视觉负责“看到什么”语言负责“知道要什么”动作头负责“做出什么”。但难点不只是每块模块本身而是三块之间的接口设计。特别是动作头它输出的动作能否与环境形成闭环反馈直接决定了模型能不能应对开放世界的动态变化。2.2 动作表达被讨论得最少、却最关键的一环这里要展开讲一个容易被忽略的点动作表达action representation。同样一个“抓取”任务你可以把动作表达成末端执行器的 6D 位姿位置加旋转关节空间的 7 个角度增量一段连续的轨迹序列离散动作 token把连续空间切分成区间每种表达方式对应不同的训练难度和推理效率。离散 token 容易让模型继承语言模型的输出习惯但会损失动作精度连续轨迹表达精度高但训练不稳定。从 VLA 领域近两年的设计趋势来看不少工作开始使用流匹配flow matching或扩散过程来生成连续动作而不是像早期模型那样直接回归动作值。为什么这么做因为动作空间有很强的多峰性——同一个任务往往存在多种合理轨迹。流匹配和扩散模型比较擅长建模这种多模态分布推理时可以采样出不同的可行方案而不是只能输出一个平均动作。这个设计取舍是理解 VLA 模型手感差异的关键。当然这里说的是通用思路。具体到 π0.5 的动作头设计和训练目标不能只看摘要就下结论需要回到论文正文去核对细节。2.3 开放世界概括在架构层面意味着什么把“开放世界概括”落到架构层面真正考验的是三件事。第一视觉编码器能不能在物体外观变化很大的情况下仍提取到稳定的语义特征。如果视觉编码器只在特定光照、特定纹理上训练过那它输出的特征本身就带偏置后面的动作头再强也很难矫正。第二语言底座能不能把“指令-场景-动作”做真正的组合推理。比如模型学会了“拿起杯子”也学会了“放到托盘”那它面对“拿起杯子放到托盘”时是机械地拼接两个技能还是能理解这是一个完整的新任务后者才是开放世界概括所需要的组合能力。第三动作策略能不能在推理时做闭环修正。现实环境是动态的物体可能在移动、光照可能在变化模型必须能根据最新的图像信息不断更新动作计划而不是只依据初始帧输出一条固定轨迹。这三件事分别对应数据、模型结构和训练策略。论文的价值在于告诉你这三个层面应该如何协同改进而不是只替换某一个模块。2.4 关于 π0.5公开信息能确认的部分严格来说目前公开渠道能确认的信息有限。从题目和关键词看π0.5 是一组围绕 VLA 模型展开的工作强调开放世界概括。至于它的模型规模、训练数据量、具体评测成绩如果论文本身没有明确给出就不适合在这里拍脑袋替你补全。我更愿意把它当作一个研究方向上的信号来看这个方向在验证“VLA 模型是否具备开放世界概括的基础能力”结果或许不完美但问题本身问对了。这正好引出下一节的话题为什么目前主流 VLA 模型在开放评测里的得分普遍不高3. 主流 VLA 模型得分普遍低于 15%不是模型不强是评测变了3.1 先还原那个“15%”现象最近具身智能社区流传一个说法主流 VLA 模型在某个开放世界评测集上的得分普遍低于 15%。这个数字如果属实确实很刺眼——毕竟很多模型在自己发布的演示视频里表现得像“开挂”一样。怎么理解这个 15%我的判断是它不代表 VLA 模型彻底不行而代表评测方式从“闭集记忆题”切换成了“开集推理题”。以前的评测是“训练集里出现过的物体、场景、指令考一考能不能做对”现在的评测变成“训练集之外的新物体、新场景、新指令组合能不能举一反三”。难度完全不是一个量级。打个比方一个学生做课本原题能考 95 分但一换成没见过的新题型成绩掉到 15 分。问题未必是学生没学而是他学的是“背题”不是“解题方法”。当前多数 VLA 模型面对开放评测时恰恰就是这种“背题型选手”。3.2 根因一训练数据的分布太干净第一个根因是数据。绝大多数 VLA 训练数据来自受控环境固定的实验室布局、标准光照、若干个固定物体、固定相机视角。模型确实能在这些数据上拟合得很好但真实世界是长尾的——物体的材质、形状、摆放方式、遮挡关系几乎无穷无尽。当训练分布和真实分布重叠太少时成功率自然直线下降。很多人调侃“机器人数据集比大模型语料稀缺得多”这不是玩笑。语言模型的训练数据来自互联网几乎覆盖了人类知识的长尾机器人操作数据却要靠真机采集或仿真生成成本高、多样性差。数据多样性不足是所有 VLA 模型泛化能力弱的第一个解释。3.3 根因二动作策略缺乏闭环纠错能力第二个根因在动作策略层面。很多 VLA 模型是开环或准开环的根据当前帧输出一段动作执行完之后再想下一步。如果在执行过程中出现偏差——比如物体被碰歪了、手掌打滑了、目标位置变了——模型并不会自动修正因为它的策略里根本没有“实时观测-修正动作”这个循环。开放世界概括的难点不只是“一开始认出物体并规划路径”更是在执行过程中不断根据新观测调整。这个能力在机器人领域叫闭环控制在 VLA 模型里却经常被弱化。模型更像一个按剧本念台词的演员而不是随机应变的即兴演员。3.4 根因三评测基准本身也在快速变化第三个根因评测基准本身存在偏向。不同 VLA 评测任务对动作精度、时序长度、物体类别的要求差异巨大。有的评测只需要模型在标准物件上做出正确抓取就得分有的评测却要求模型在真实物理环境中连续完成多步操作。前者分数高不代表模型真的强后者分数低也不意味着模型一无是处。换句话说“低于 15%”更像一面镜子照出了 VLA 模型在“真正进入真实世界”这件事上还差多远。对开发者来说这个数字反而有价值它提醒你看论文时别只盯着演示视频要多看模型在独立评测集上的泛化表现。3.5 这对 π0.5 意味着什么如果 π0.5 真的在开放世界概括上做文章那它大概率会从数据多样性、动作生成策略、评测方式三个方向同时发力。这也就是为什么我认为这类论文值得读它提供了一个“在 15% 的时代里怎么把模型往上抬”的思路样本。不过要提醒一句从 15% 到 50%中间还有很长的路。任何声称“解决了开放世界泛化”的论文都需要用独立第三方评测来检验而不是只看作者自己定义的 benchmark。4. 仿真在具身智能里的真实位置数据工厂、加速器但不是终点4.1 为什么仿真在 VLA 开发中越来越重要回到热搜里的另一个关键词“具身智能机器人模拟”。为什么仿真如此重要因为真实操作数据的采集成本太高了。一台机械臂、一个工程师、一天八小时采集到的有效操作轨迹可能只有几百条还伴随着设备损耗、安全风险和各种意外。相比之下仿真环境可以并行跑几百个实例一天生成几万条轨迹。所以仿真在 VLA 开发流程里的第一个角色是“数据工厂”大量生成训练数据覆盖不同的物体形状、颜色、光照、视角和任务组合。数据多样性上去了模型的泛化基础才有改善的可能。第二个角色是“压力测试场”。在仿真里你可以批量测试模型对光照变化、物体位置扰动、相机噪声的鲁棒性快速定位模型的短板而不是每次都跑到真机上做代价高昂的实验。4.2 常见仿真工具怎么选仿真工具适合场景特点上手难度MuJoCo连续控制、强化学习、机械臂基础操作轻量、快社区成熟低PyBullet快速原型验证、教学简单直接容易调试低Isaac Sim / Isaac Lab高质量渲染、大规模并行训练、操作任务基于 NVIDIA Omniverse视觉真实度高中SAPIEN关节物体操作、室内场景面向物体交互的 benchmark 友好中高Habitat具身导航、室内场景理解擅长导航类任务中这里没有绝对最优的选择。如果只是入门我建议从 MuJoCo 或 PyBullet 开始先把强化学习和基础操作跑通如果后面要研究真实感渲染或大规模并行训练再转向 Isaac Sim。4.3 sim-to-real gap仿真模型为什么到真机就失灵仿真的核心痛点每个人都有耳闻sim-to-real gap也就是仿真到真实的差距。差距的来源很多物理引擎不等于真实物理摩擦力、弹性形变、接触力都不是完美模拟的。渲染不等于真实视觉真实的相机噪声、光照反射、材质表现远比渲染器复杂。执行器延迟和噪声真实机械臂有控制延迟和关节噪声而仿真默认是理想执行。因此仿真训练出的策略直接