公司动态
影溯开源 QuerySplat 技术:秒级生成 3D 场景,Transformer 开启空间智能新征程
从 2D 像素到 3D 场景 Query影溯推动三维内容生产变革影溯正在尝试把三维内容生产推向可规模化调用的新阶段。用手机围着小摆件、咖啡店、卧室等拍摄几张照片几秒后它们就能从二维照片中「立」起来变成可把玩、可自由探索的 3D 内容。这款名为 Crystal 空间相机的 App是影溯将最新研究成果做成的免费 3D 捕捉工具让人们能轻松体验拍摄 3D 空间照片。开源 QuerySplat 技术加速 3D 内容生产规模化影溯正式开源前馈式 3D Gaussian Splatting 生成技术 QuerySplat只需输入少量不同视角、无需提供相机位姿的图片即可在一次前向推理中秒级生成可自由切换视角的 3D 场景。在大规模 DL3DV - Evaluation 基准的 2、4、12 视图设置中Topos - Lite 在 PSNR 和 SSIM 指标上均取得最优结果在更关注感知相似度的 LPIPS 指标上也在 2 视图和 4 视图设置中排名第一。影溯开源 QuerySplat希望推动前馈式 3D 生成走向行业共同验证、迭代的技术基础加速 3D 内容生产规模化。Topos - Lite改变模型组织三维空间方式Topos - Lite 最值得关注的是改变了模型组织三维空间的方式。过去不少前馈式 3DGS 方法采用像素对齐范式存在先天问题如不同视角像素误差会导致三维空间冲突。而 Topos - Lite 采用 Query - based 思路让一组可学习的 Query 充当「场景级位置」使 Transformer 熟悉的机制承担起组织三维场景的角色。它只需输入随手拍照片就能快速生成 3D Gaussian 场景生成结果主体轮廓更完整纹理更清晰场景结构更干净稳定。与传统方法相比前馈模型改变了成本结构对普通用户来说拍摄图片更少、无需手动标定、等待时间压缩到秒级。Topos - Lite 在 DL3DV - Evaluation 的多种稀疏视图设置中取得当前最强整体表现还提供了容量扩展接口。其性能处于早期研究阶段未来品质与精细度将持续跃升有望在端侧高效运行。下一代人工智能需理解空间在影溯看来过去十年人工智能主要学习人类表达的世界下一阶段需理解世界本身。二维图片和视频是三维世界的投影模型从二维像素学习需处理诸多变化和冗余信息。引入三维能将「世界是什么」和「我们怎样看见世界」分开让模型学习更紧凑、稳定的空间表征。空间智能不是 AI 的边缘分支而是从数字智能走向物理智能必须掌握的基本能力。技术突破背后的近二十年积累空间智能发展需解决诸多工程细节问题影溯核心团队在 SLAM、三维视觉和空间智能领域有近二十年积累。创始人章国锋教授长期追问机器如何理解真实三维世界他本科和研究生均学计算机专业研究生时加入鲍虎军教授团队进入三维视觉领域。他完整经历了三维技术的发展在高校研究和商汤工作的经历使他能将前沿算法转化为产业动能。联合创始人刘浩敏博士及其团队的工程化能力进一步放大了这些成果。影溯团队结构特别既有长期积累的成员也有年轻研究者参与核心课题。Topos - Lite 的关键突破由团队中的「00 后」研究员主导完成。三维技术先入真实场景再成机器理解世界的数据空间智能终局虽大但三维技术可先降低生产门槛满足人们的记录、展示与创作需求。在空间记录方面三维生成简单快速低成本可将照片变成「空间照片」记录生活的媒介可能随之改变。在空间展示与远程体验领域快速生成可浏览的三维场景能让相关行业有更直观的表达方式降低成本。在生成式内容生产方面能让二维生成、视频制作和三维场景建立更直接连接。对机器人而言三维世界是其仿真、验证和学习的训练场。先让三维技术进入真实场景再用数据训练空间智能是三维数据走向规模化的现实路径。终局让智能真正进入空间对影溯而言世界模型是技术路径空间智能是长期方向。它希望构建能在现实世界验证空间理解能力的智能。Topos - Lite 解决了基础现实问题让 Transformer 从少量二维观测中组织出三维场景也让影溯的长期判断落实到技术结果上。未来空间智能架构尚无定论但空间理解是机器进入真实世界绕不开的能力影溯希望参与建设面向物理智能的基础设施。Topos - Lite 证明三维场景能更快、更清晰生成且可开放调用Transformer 的处理对象延伸到连续三维空间。