公司动态
3D 视觉论文精读
一、趋势① 简单介绍CVPR2026 的 3D 视觉方向共收录并解读 156 篇论文覆盖从底层几何表示、重建渲染到生成式 3D、场景理解、SLAM 与机器人具身的完整技术栈。它不是独立小方向而是连接「感知—重建—生成—理解—行动」的中枢也是大模型化、实时化浪潮中最先被「重做一遍」的视觉子领域。② 方法范式趋势三化合一本届最显著的特征是方法底座的高度收敛与叠加3D 高斯泼溅3DGS作为可微辐射场已成为横跨 15/18 类、71 次出场的统一几何引擎与此同时Transformer / 自回归大模型Decoder-only 系列合计横跨 14 类把「3D 当作序列/语言」推向主流而以 VGGT/π³ 为代表的前馈式重建则用一次推理替代逐场景优化。三股力量叠加而非互相替代。③ 问题 frontier从标准场景走向难场景当室内/物体等标准场景被基本攻克研究算力正集体转向过去「做不好」的真实边缘事件/脉冲相机、第一人称与全年龄段人体、铰接物体、反光/透明/弱纹理材质22TB 级数据集、形变与零样本/类别无关。生成式方向则首次系统引入 RL / 偏好对齐如 Hi-GRPO来对齐人类审美与物理合理性。二、方法下表按「论文覆盖度」统计各方法家族——即 156 篇中至少使用一次该家族技术的论文数量与占比一篇可同时归属多个家族方法家族涉及论文占比简单介绍3D 高斯泼溅 / 辐射场7548.1%用可微高斯/辐射场作为统一几何与外观表示覆盖重建、渲染、SLAM、动态与生成。Transformer / 自回归大模型2918.6%把 3D 当序列/语言前馈重建、3D token、自回归生成与 3D-LLM 全面上位。扩散生成85.1%文/图/动作生 3D/4D强调可控、拓扑一致并引入 RL/偏好对齐优化审美。前馈几何重建117.1%单次前向推理直接输出深度、点云、相机与轨迹取代逐场景优化。经典几何 / 优化2113.5%代价体、运动恢复结构与刚体群仍是鲁棒性的基石与可微渲染深度融合。异质传感 / 高效架构117.1%脉冲/事件相机、线性复杂度架构把 3D 推向高速、暗光、边缘等极限工况。读表要点3DGS 48.1%成为绝对底座Transformer/自回归大模型紧随其后标志 3D 进入「大模型化」经典几何代价体/SfM/SE(3)仍被 21 篇复用说明可微渲染并未取代几何而是与之融合扩散生成与前馈几何是两条上升的新主线。三、主题分类、应用场景与每类一篇论文精读论文可归为 18 个细类并可进一步聚为 6 大宏观主题群。每个细类给出简述 / 意义 / 代表。A 组 · 表征与重建底座1. 3D 高斯泼溅重建、渲染与表征简述围绕 3D Gaussian Splatting3DGS的渲染质量、分辨率、存储与表面重建做工程与算法改进。意义3DGS 已成为实时辐射场重建的事实标准本类聚焦如何让它更省显存、任意分辨率无锯齿、支持表面提取与跨实例配准是大量下游任务的底层引擎。代表3D Gaussian Splatting at Arbitrary Resolutions with Compact Proxy Anchors2. 3D 高斯泼溅SLAM 与定位简述把 3DGS 作为地图表示接入 SLAM / 视觉定位处理曝光变化、位姿不准与实时性。意义将可微辐射场与定位紧耦合是替代传统特征点地图的新一代稠密 SLAM 路线直接影响机器人导航与 AR。代表AERGS-SLAM: Auto-Exposure-Robust Stereo 3D Gaussian Splatting SLAM3. 网格与表面重建简述从图像/点云恢复显式网格、CAD(B-rep)、UDF 表面与连续切片。意义显式表面是制造、仿真与编辑的刚需关注拓扑自适应、薄结构与可微表示。代表BRepGaussian: CAD Reconstruction from Multi-View Images with Gaussian Splatting4. 新视角合成与视角编辑简述给定少量视图生成任意新视角或做可控的视角/立体/风格编辑。意义新视角合成是 3D 内容生产与影视/VR 的基础能力强调外推、可控性与跨视角一致性。代表Beyond Geometry: Artistic Disparity Synthesis for Immersive 2D-to-3DB 组 · 动态与 4D 世界1. 动态 / 4D 场景重建简述从单目/多目/无人机视频重建带时间的 3D 场景处理运动分解、遮挡补全与物理一致性。意义4D 重建是数字孪生、具身智能与视频生成的交汇点关注如何得到几何完整、时间连贯、可编辑的动态世界模型。代表4D Primitive-Mâché: Glueing Primitives for Persistent 4D Scene Reconstruction2. 立体匹配、事件与脉冲视觉简述事件相机 / 脉冲相机的立体匹配、深度与场景重建以及非对称双目装置。意义事件/脉冲相机提供微秒级、高动态范围感知是高速、暗光与无帧率场景的刚需技术栈与传统 RGB 差异大。代表ARES: Unifying Asymmetric RGB-Event Stereo for Probabilistic Scene Flow Estimation3. 深度估计单目 / 立体 / 全景 / 事件简述从单张图、立体对、全景或事件流恢复度量或相对深度。意义深度是几乎所有 3D 任务的底层几何信号本类覆盖从极稀疏 dToF 补全到全景基础模型的多模态方案。代表AIMDepth: Asymmetric Image-Event Mamba for Monocular Depth EstimationC 组 · 前馈几何与感知1. 多视图几何与前馈重建简述用前馈网络如 VGGT/π³ 系一次推理直接输出深度、点云、相机与轨迹。意义前馈式重建把传统逐场景优化变成通用模型推理是实时 SLAM、视频 3D 理解与具身感知的新范式。代表AMB3R: Accurate Feed-forward Metric-scale 3D Reconstruction with Backend2. 点云处理配准 / 分析 / 压缩简述点云的配准、域自适应、分类分割与几何压缩。意义点云是激光雷达与扫描仪的直接输出是自动驾驶、机器人抓取与三维理解的核心数据格式。代表AnyPcc: Compressing Any Point Cloud with a Single Universal Model3. 6D 物体位姿估计简述估计物体在三維空间中的 6 自由度位姿旋转平移含类别级、零样本与形变情形。意义6D 位姿是机器人抓取与 AR 放置的前提趋势是从 CAD 依赖走向零样本、开放类别与抗形变。代表AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment4. SLAM 与视觉定位非 3DGS简述特征/坐标回归式的视觉定位、SLAM 与视角选择。意义定位是移动智能体的空间锚关注大规模、动态、暗光与边缘设备的鲁棒性。代表AsymLoc: Towards Asymmetric Feature Matching for Efficient Visual LocalizationD 组 · 生成式 3D / 4D1. 3D 生成文 / 图生 3D简述从文本、图像或视频生成 3D 资产、动画与场景含偏好对齐与编辑。意义生成式 3D 是内容工业化的核心关注如何得到拓扑一致、可编辑、且符合人类审美偏好的资产。代表Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation2. 铰接物体重建与生成简述椅子、剪刀等含关节的可动物体的重建、位姿与生成。意义铰接物体是室内场景的主体其部件级运动建模对仿真、机器人与生成式 3D 资产至关重要。代表ART: Articulated Reconstruction TransformerE 组 · 场景理解与人体1. 3D 场景理解简述3D 语义/实例分割、可供性、变化检测、稠密描述与开放词汇理解。意义让机器“读懂”三维场景的语义与功能是导航、交互与决策的上层智能。代表AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers2. 人体与头像重建简述单目/多视角下的人体网格、手势、人群与可驱动 3D 头像含第一人称。意义数字人、虚拟穿戴与具身交互的基础强调全年龄段、遮挡鲁棒与实时可驱动性。代表AvatarPointillist: AutoRegressive 4D Gaussian AvatarizationF 组 · 具身、数据与方法论1. 机器人 / 具身智能简述把 3D 感知用于抓取、双臂操作、装配与导航的策略与系统。意义3D 视觉落地的终极场景强调把几何先验、可供性与多视角一致性转化为可执行动作。代表GAP: Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation2. 数据集 / 基准 / 综述简述新数据集、评测基准与领域综述。意义数据是 3D 研究的瓶颈本类揭示材质/形变/第一人称等长期被忽略的空白与评测陷阱。代表3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, Low-Texture Objects3. 自监督 / 预训练 / 表征学习简述无需 3D 真值的前馈 3D 表征学习与蒸馏。意义用 2D 视频与多教师蒸馏“白嫖” 3D 感知是降低对稀缺 3D 标注依赖的关键路线。代表3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds