单目视频中的4D人体重建测试,无法揭示哪些关于4D重建的信息?

单目视频中的4D人体重建存在隐藏盲区:遮挡、大形变以及视角差异,这些往往是测试中容易遗漏的问题。

直接答案

4D重建测试可能无法揭示从单目视频构建的人体模型中的关键盲区——尤其是方法如何处理被遮挡的身体部位、大幅衣物形变,以及远离原始相机路径的视角。例如,一种方法[3]专门针对先前工作遗漏的宽松衣物和物体交互,而另一种方法[4]则表明,在没有额外几何约束的情况下,大角度相机重定向往往会失效。纵观这些研究,一个共同的主题是:在简单、紧身衣物或接近原始视角的条件下进行测试,可能会掩盖仅在挑战性情境下才显现的严重几何和运动误差。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何测试常常无法揭示被遮挡区域的重建有多糟糕

单目视频只能看到人的正面,因此身体后方或被衣物遮挡的部分只能靠猜测。标准测试可能不会强调这一点,但那些明确处理遮挡问题的方法恰恰揭示了其中的关键所在。例如,[2]指出许多方法在遮挡区域的形状补全上存在困难,而他们的方法正是为了填补这些空缺而设计的。如果测试只评估可见表面,就可能给人一种虚假的准确感——不可见部分可能错得离谱,却完全不影响得分。

同样地,[3]聚焦于极度宽松的衣物和手持物体,这些会带来大面积遮挡和复杂形变,而紧身衣物基准测试则忽略了这些情况。他们的结果表明,仅靠通用人体先验知识是不够的;还需要针对视频的形变层来捕捉衣物的细微几何结构。因此,如果测试不包含此类具有挑战性的案例,就无法揭示模型实际上是在凭空臆造飘动外套或手持包袋的形状。

隐藏的失效模式:大幅度动作与快速运动

许多重建方法假设帧间形变较小且平滑,但真实的人体运动可能既快速又剧烈。使用缓慢、简单的动作进行测试无法暴露这一缺陷。[2]明确指出,现有方法在处理大幅场景形变时存在困难,为此他们引入了场景流损失以应对更大的运动。若缺乏此类机制,当人快速挥动手臂或跳跃时,模型可能会生成模糊或破碎的网格。

即便是像[1]这样的先进方法——它能在约6分钟内从数百帧图像重建4D场景——也侧重于效率与质量,但仍依赖可能无法覆盖极端姿态的先验知识。[5]表明,基于Transformer的模型能比以前更好地分析异常姿态,但这仅适用于单张图像,而非完整的4D重建。因此,仅使用典型行走或站立姿态的测试,无法揭示模型在面对现实生活中的快速、非刚性运动时表现如何。

当相机偏离原始路径时会发生什么

单目视频仅捕捉到四维世界的一个狭窄切片,因此从新相机角度进行渲染的任何尝试都是不适定的。那些贴近原始视角的测试无法暴露这一问题,但大角度重定向往往以失败告终。[4]表明,基于扩散的方法在大角度变化下会失效,产生严重的几何模糊和时间不一致性。他们的解决方案是构建一个前景完整的四维代理作为结构锚定,从而在具有挑战性的轨迹下提升忠实度与连贯性。

这意味着,从原始相机路径观看时,重建结果可能看起来完美无缺,但一旦你围绕人物旋转视角,几何结构就可能发生扭曲或闪烁。仅与输入视图进行比较的标准评估指标完全无法捕捉到这一问题。[4]的实验专门测试了大角度轨迹,结果表明,如果没有额外的几何支撑,模型的输出会显著退化——而这种失败是常规测试无法发现的。

关于这些资料来源

本回答基于5项同行评审研究——发表于2023年至2026年间,其中3项为2024年或之后发表,合计被引用179次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的30篇文献。

本文引用的文献

1

4D-Fly:从单目视频快速进行4D重建

4D-Fly能够在大约6分钟内从数百帧的单目视频中重建出4D场景,声称相比以往的优化方法实现了超过20倍的加速,并且质量更高,但它仍然依赖于可能无法覆盖极端形变的数据先验。

2

无偏4D:基于神经变形模型的单目4D重建

Ub4D利用神经变形模型和场景流损失来处理遮挡区域中的大变形与形状补全,与先前工作相比,在表面精度和鲁棒性方面均有提升。

3

DressRecon:基于单目视频的自由形式4D人体重建

DressRecon针对极度宽松衣物和物体交互场景,将通用人体先验与视频特有的“骨骼袋”形变相结合,在具有挑战性的数据集上实现了比现有方法更高保真度的重建效果。

4

FreeOrbit4D:基于前景完整4D重建的单目视频免训练任意相机重定向

FreeOrbit4D表明,从单目视频进行大角度相机重定向常常因缺乏视觉锚定而失效,而其前景完整的4D代理在该类轨迹下提升了保真度与时间一致性。

5

人类4D:利用Transformer重建与追踪人类

4DHumans采用基于Transformer的人体网格恢复技术(HMR 2.0)来处理异常姿态,并能在遮挡情况下对多人进行持续跟踪,从而在单目视频中实现了最先进的跟踪效果。