公司动态
港科大新作MSVS-VAE:解码速度快10倍!紧凑度高10倍!20K token即可超越体素SOTA
「打破了“准”和“省”的物理极限」目录01 三大核心创新模块拆解1.1 AVS-Conv抛弃全局注意力几何感知局部聚合算子1.2 分层点洗牌上采样PSU逐层扩充潜空间建模容量1.3 多尺度查询解码MSQ粗细尺度特征融合降噪02 训练目标与整体管线流程编器流程解码器流程损失函数03 实验结果3.1 定量指标横向对比3.2 定性可视化差异3.3 解码速度实测3.4 测试时缩放特性3.5 消融实验核心结论04 总结当下3D生成领域的核心底座是潜扩散模型而3D VAE的重建能力直接决定最终资产细节。现有方案长期困在两条路线的取舍中稀疏体素方案准但贵——细节清晰却显存、算力开销巨大集合式VecSet方案省但糙——存储极致精简却被潜空间稀疏与全局注意力过度平滑拖累精细结构还原能力断层。来自香港科技大学、北京大学、香港科技大学广州、光子工作室的联合团队推出MSVS-VAE用层级点洗牌上采样架构首次打通两条路线壁垒不牺牲向量集紧凑优势的前提下重建精度拉至体素方案水准解码比此前VecSet方法快约10倍表示比体素基线紧凑约10倍。仅20K token即可超越部分体素SOTA模型后者需210K token在Objaverse、ABO、真实野外等多类数据集全面领先为轻量化3D扩散生成提供全新底层编码方案。01 三大核心创新模块拆解整套模型分为编码器、解码器两大模块解码器包含分层点洗牌上采样PSU、AVS-Conv局部卷积、多尺度查询解码MSQ三个核心组件三者耦合才能实现精度与效率双提升。1.1 AVS-Conv抛弃全局注意力几何感知局部聚合算子传统VecSet解码全程使用全局交叉注意力空间无关token相互干扰细节被抹平。论文设计AVS-Conv替代全局注意力核心逻辑仅在查询点K近邻范围内聚合特征。图 | MSVS 三大核心模块示意图 (a) AVS-Conv 算子(b) 点洗牌上采样(c) 多尺度查询解码简单理解其计算逻辑对任意查询坐标仅检索欧氏距离最近K个支持特征利用相对坐标生成动态权重加权融合搭配均值池化残差支路稳定训练。公式简化解读由相对偏移经过MLP生成仅局部特征参与计算彻底规避全局遍历。该算子编码器、解码器通用但输入输出集合不同编码器以表面点为支持、锚点为查询解码器以上采样潜token为支持、网格查询点为查询。消融实验证明仅替换全局注意力就能将解码速度提升5倍以上同时保留局部几何细节。1.2 分层点洗牌上采样PSU逐层扩充潜空间建模容量VecSet精度不足的根源是潜token数量太少直接加token会成倍增加算力。PSU采用分层扩容思路不整体扩容、逐级细分锚点。每一层上采样中单个锚定潜向量会拆分为r个子特征同时预测r个空间偏移生成新子锚点单层token总数扩大r倍特征通道同步减半整体特征总预算基本不变不会出现算力爆炸。扩容后再用AVS-Conv做自聚合平滑新增潜向量特征。图 | 模块消融定量结果移除多尺度查询 / 点洗牌上采样消融数据直观证明PSU是整套模型最关键模块移除PSU后Objaverse数据集Mesh Distance从1.395飙升至3.693精细几何直接丢失可视化对比图5可见无PSU模型镂空、曲面位置出现大量破损噪点。1.3 多尺度查询解码MSQ粗细尺度特征融合降噪仅使用最高分辨率细潜层会带来高频噪点、曲面凹凸不平只依赖粗尺度又丢失局部细节。MSQ同时对多层不同分辨率潜特征执行AVS-Conv查询拼接后轻量化网络融合再输出SDF预测值。粗尺度潜向量提供全局完整拓扑约束避免模型断裂细尺度负责雕刻棱角、镂空等微小结构二者互补大幅降低单尺度带来的伪影。消融实验中关闭MSQ后所有数据集重建误差均明显上涨曲面噪点显著增多。02 训练目标与整体管线流程编器流程输入带法向量的点云轻量PointNet提取逐点特征选取网格中心作为锚点使用AVS-Conv从表面点聚合特征生成初始VecSet潜向量堆叠自注意力块优化全局特征关联输出基础紧凑潜集合。图 | MSVS-VAE 完整管线总览解码器流程基础潜向量送入多层PSU逐级加密生成多分辨率分层潜空间全部尺度潜特征送入多尺度查询模块融合局部几何特征预测截断有向距离函数TSDF。损失函数整体损失由重建损失KL正则项组成仅保留核心逻辑采用截断SDF监督仅重点优化物体表面附近数值忽略远距离无效空间KL损失约束潜分布趋近标准正态适配下游3D扩散模型训练。训练采用分阶段渐进策略先固定4K全局token预训练完整模型学习全局拓扑再对模型随机局部裁剪微调同一批token集中优化局部细节大幅缓解显存压力。03 实验结果实验分为定量指标、定性可视化、推理效率、消融四大维度同时区分指标纸面数值与实际工程价值不单纯堆砌SOTA标签3.1 定量指标横向对比图 | 基于 Objaverse、ABO、野外数据集的 VAE 重建量化对比评测数据集Objaverse、ABO、野外真实复杂模型指标采用Mesh DistanceMD越小越好、不同阈值F1分数越高代表表面匹配越精准。集合式基线对比Lattice、Hunyuan3D2.1、Dora4K token同等预算下MSVS-VAE的Objaverse MD5.644远低于Lattice 11.502、Dora 17.352细微结构匹配度大幅领先20K token时MSVS-VAE MD1.695已经超越绝大多数体素方案而SparseFlex-1024需要210K token数量是本方案10倍。体素基线对比SparC3D、SparseFlex、Direct3D-S2MSVS-VAE 40K token在全部数据集MD指标全面优于SparC3D50K体素针对带尖锐硬边的Dora-Bench数据集40K token版本S-MD硬边误差低至2.99锐利细节还原能力超过多数体素模型。指标局限说明Mesh Distance是全局平均误差仅代表整体曲面贴合度面对超精细发丝、薄片类极端微结构即便MSVS-VAE仍会存在轻微丢失是集合式连续表征天然短板无法完全规避。3.2 定性可视化差异从雕像、机械、灯具等复杂模型对比可见图 | 各类 VAE 重建定性对比图传统VecSetLattice、Dora曲面模糊镂空结构粘连结构粘连体素模型SparseFlex出现明显孔洞、拓扑断裂红圈标注MSVS-VAE完整保留精细花纹、机械薄壁、链条等细节曲面连续无破损水密性更强。3.3 解码速度实测以20万点查询为标准批次图 | 各方法 SDF 查询推理延迟对比Lattice 40K token推理耗时3068msMSVS-VAE仅213ms提速14.4倍token数量越大速度优势越明显核心来自AVS-Conv局部计算替代全局注意力。3.4 测试时缩放特性图 | 不同方法网格距离随 token 数量变化曲线推理阶段可自由调整token数量4K轻量化快速生成40K高精度资产一套模型适配快速预览、精细出图两类场景体素模型无法灵活调整分辨率固定网格尺寸限制使用弹性。3.5 消融实验核心结论图 | 模块消融定性对比完整模型、移除多尺度查询、移除上采样模块PSU分层上采样整套模型最核心增益模块移除后几何细节大面积丢失误差翻倍MSQ多尺度融合次要关键模块消除单尺度带来的曲面噪点全局稳定性提升AVS-Conv效率核心解码速度提升数倍同时不损失重建精度。04 总结MSVS-VAE交出了折中最优解在不放弃集合式表征高压缩、高推理速度优势的前提下把重建精度拉到主流体素模型梯队填补了轻量化高精度3D编码的空白。对于游戏资产、AI文生3D、仿真道具批量生成等需要兼顾速度、显存与模型细节的场景这套分层VecSet架构具备极高工程落地价值后续若拓展纹理支路、优化微结构建模有潜力成为下一代通用3D扩散标准VAE底座。Ref论文标题MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction论文链接https://arxiv.org/abs/2607.24436