跳到主要内容
返回博客

技术案例 · 室内新视角合成

室内三维重建:Dr Johnson 与 Playroom 的图像对照与定量评估

MakeWorlds 在 Dr Johnson 与 Playroom 两个公开室内场景中,从输入照片自行完成相机求解与场景重建,保留了柜体轮廓、地毯重复纹样和书架物品层次。本批次 Mac 结果在两个场景上的 PSNR、SSIM、LPIPS 均优于原始 3DGS 论文报告的对应参考值。本文结合完整测试集数据与四组照片/渲染对照,说明这些结果具体体现在哪里。

MakeWorlds 团队 · 测试日期

1. 完整测试集结果

下表覆盖 Dr Johnson 的全部 16 个测试视角与 Playroom 的全部 14 个测试视角。与文献参考值相比,两个场景均记录了更高的 PSNR、SSIM 和更低的 LPIPS;四组配图用于后文的细节分析。

以下数值采用已公开的论文对比口径,未使用校色后分数;文献参考值取自原始 3DGS 论文附录的 30,000 步结果。相机与测试视角设置并非完全相同,差值作为与文献报告值的参考比较。 [1] 查看比较条件与适用范围

Dr Johnson · Mac · 全部测试视角均值 · 论文对比口径
Δ = MakeWorlds − 论文。PSNR / SSIM 越高越好,LPIPS 越低越好。
结果PSNR ↑ / dBSSIM ↑LPIPS ↓
3DGS 论文报告值28.7660.89900.2440
MakeWorlds · Mac29.180Δ +0.4140.9124Δ +0.01340.2215Δ −0.0225
Playroom · Mac · 全部测试视角均值 · 论文对比口径
Δ = MakeWorlds − 论文。PSNR / SSIM 越高越好,LPIPS 越低越好。
结果PSNR ↑ / dBSSIM ↑LPIPS ↓
3DGS 论文报告值30.0440.90600.2410
MakeWorlds · Mac30.385Δ +0.3410.9148Δ +0.00880.2264Δ −0.0146

PSNR 与 SSIM 上升、LPIPS 下降,在两个场景中给出一致的正向结果。这三项指标分别从像素误差、局部结构和感知特征描述本批次的图像表现。后面的场景对照进一步展示了柜体轮廓、地板接缝与细密纹样等具体内容。

2. 从输入照片到测试视角

Dr Johnson 与 Playroom 来自公开的 Deep Blending 数据集,也是原始 3DGS 论文使用的室内评测场景。本文采用 2026 年 10 月 1 日已公开测试批次中的 Mac 结果,图像和指标来自同一平台、同一批次。 [2]

项目Dr JohnsonPlayroom
输入照片263225
测试视角数1614
本文展示视角数22
配图分辨率1332 × 8751264 × 832

测试使用 Apple M4 Max,设置为 Medium、原始分辨率、30,000 步。MakeWorlds 从输入图像自行求解相机,再进行场景训练并输出测试视角的渲染结果。测试视角在训练前确定,对应图像不参与场景训练优化,评估时逐一与参考照片比较。

四组展示视角分别覆盖柜体与壁炉、玩具与地板、地毯花纹和书架细节,未按最高分筛选。每组照片与渲染保持相同的显示方向和裁剪范围,便于将表中的场景级结果落实到具体部位。

3. Dr Johnson:柜体轮廓与装饰分格

这组重建画面同时保留了房间布局和家具内部的结构层次。深色木柜的外轮廓、柜门拱形饰线及横向分格,与参考照片中的位置和形态有明确对应;白色壁炉的台面、立柱和墙面饰线也能连续追踪。深色柜体、绿色墙面和白色壁炉之间的交界,为检查不同尺度的边缘提供了直观依据。

Dr Johnson 的木柜、白色壁炉与绿色墙面的 MakeWorlds 渲染
Dr Johnson 的木柜、白色壁炉与绿色墙面的原始照片
原始照片MakeWorlds 渲染

图 1 · Dr Johnson,Mac,view-000040。柜门拱形分格、木柜外轮廓与壁炉饰线在重建中得到保留。左侧为参考照片,右侧为 MakeWorlds 渲染。

柜体外轮廓和内部装饰在同一幅画面中同时得到表达,展示了从主体结构到局部细节的保留情况。窗边高亮与个别细边缘仍有可见差异,可以沿对应区域移动滑块查看。

4. Playroom:色彩、物体边界与地板纹理

Playroom 展示了多个尺度的内容:彩色地毯的分带和边缘、拼接地垫上的字母、分散摆放的玩具,在渲染中都有对应的形状与位置。右侧木地板的接缝方向、局部木结与色差也得到表现。将这些区域一起观察,可以看到重建保留了大面积色彩关系、独立物体轮廓和表面纹理。

Playroom 中的彩色地毯、玩具与木地板的 MakeWorlds 渲染
Playroom 中的彩色地毯、玩具与木地板的原始照片
原始照片MakeWorlds 渲染

图 2 · Playroom,Mac,view-000184。地毯条纹、地垫字母、玩具轮廓与地板接缝构成了从整体外观到局部纹理的对照。

5. 局部细节:重复花纹与书架内容

地毯与书架进一步展示了细节保留的层次。Dr Johnson 的地毯边框保留了连续排列的重复花纹,中央多个纹样的形状和位置也能与照片对应。Playroom 中,相邻书脊的宽度与颜色、文件夹的倾斜关系和堆叠物品的层次得到保留;上层绿色书脊上的书名仍可辨认。下面两组采用相同位置和比例放大,方便逐处核对已有细节。

Dr Johnson 的地毯、椅子与木地板的 MakeWorlds 渲染
Dr Johnson 的地毯、椅子与木地板的原始照片
原始照片MakeWorlds 渲染

图 3a · Dr Johnson,view-000248。地毯边框与中央重复纹样能够逐项对应;部分细纹和椅背边缘仍有柔化。

Playroom 中的书架、文件夹与柜门的 MakeWorlds 渲染
Playroom 中的书架、文件夹与柜门的原始照片
原始照片MakeWorlds 渲染

图 3b · Playroom,view-000089。书脊和文件夹保持各自的轮廓、色彩与排列,上层较大字号的书名仍可辨认,更小的文字有不同程度的柔化。

6. 如何把图像细节与指标联系起来

前面的对照覆盖了房间布局与大色块、物体边界与遮挡、重复纹样与文字笔画三个观察尺度。定量评估将图像差异汇总为像素、局部结构和感知特征层面的度量。将图像与指标结合,可以同时保留可核对的数值和具体部位的观察。

PSNR ↑
PSNR 根据像素均方误差计算,数值越高,表示当前比较条件下的像素误差越小。图像对齐、亮度和颜色偏差都会影响这一指标。
SSIM ↑
SSIM 比较局部亮度、对比度和结构关系,数值越高,表示这些图像特征越接近参考。它为像素误差补充了局部结构层面的观察。 [3]
LPIPS ↓
LPIPS 用深层特征比较感知距离,数值越低,表示与参考图像越接近。特征网络和预处理方式会影响数值,因此跨实现比较需要统一口径。 [4]

从公开的 3D Gaussian Splatting 图像形成模型看,场景由空间高斯基元表示。渲染时,将这些基元投影到图像平面,再按深度顺序进行透明度合成。省略背景项后,像素颜色可写为: [1]

C(u, d) = ∑i Ti(u) · αi(u) · ci(d)Ti(u) = ∏j<i [1 − αj(u)]

式中,u 为像素位置,d 为观察方向;α 综合了高斯投影的覆盖与不透明度,T 表示光线经过前方基元后剩余的透射率。多个基元的贡献共同形成像素颜色,因此观察室内图像时,需要同时关注覆盖范围、前后遮挡和局部颜色变化。柜门分格、玩具边缘与重复花纹分别提供了这些现象的具体观察位置。

7. 结论与适用范围

在这两个公开室内案例中,MakeWorlds 的重建结果同时保留了场景布局、家具结构和纹理细节,完整测试集指标也呈现出一致的正向表现。从输入照片自行求解相机并完成重建后,产品输出了细节丰富、能够逐项核对的室内画面。柜门分格、地毯花纹和书架内容,都是这一能力的具体体现。

本文选用的是已公开评测中三项指标均优于论文参考值的两个室内案例。MakeWorlds 自行求解相机,相机估计、测试视角集合和完整处理流程未与论文实验严格对齐。因此,表中差值用于参考已记录结果与文献报告值,不构成同条件算法排名,也不能隔离某个组件的贡献。

本文结论针对这两个场景和本次设置下的测试视角图像保真度。用于尺寸测量时,需要补充独立几何真值、尺寸误差与表面验证;用于连续漫游时,需要检查相机运动中的闪烁、遮挡切换和新暴露区域。这些验证未包含在本篇中。

本批次未报告重复运行的方差或置信区间,差值作为观测结果呈现,不作统计显著性声明。

测试条件与数据来源
输入
Dr Johnson:263 张输入照片;Playroom:225 张输入照片。
设置
Medium、原始分辨率、30,000 步;配图与指标均取自同一测试批次的 Mac 结果。
配图
Dr Johnson:view-000040、view-000248;Playroom:view-000184、view-000089。 配图用于观察布局、边界和纹理,未按最高分筛选。每张渲染图都与对应参考照片配对,并保持相同的显示方向与裁剪范围。

公开数据集:Deep Blending。 Deep Blending

参考文献与公开数据

图像形成模型和指标解释参考下列公开文献;实验数字来自 MakeWorlds 已公开的场景评测记录。

  1. Kerbl et al. (2023). 3D Gaussian Splatting for Real-Time Radiance Field Rendering.
  2. Hedman et al. (2018). Deep Blending for Free-Viewpoint Image-Based Rendering.
  3. Wang et al. (2004). Image Quality Assessment: From Error Visibility to Structural Similarity.
  4. Zhang et al. (2018). The Unreasonable Effectiveness of Deep Features as a Perceptual Metric.

查看完整三平台实测 · 了解照片采集方法