为何测试常常无法揭示被遮挡区域的重建有多糟糕
单目视频只能看到人的正面,因此身体后方或被衣物遮挡的部分只能靠猜测。标准测试可能不会强调这一点,但那些明确处理遮挡问题的方法恰恰揭示了其中的关键所在。例如,[2]指出许多方法在遮挡区域的形状补全上存在困难,而他们的方法正是为了填补这些空缺而设计的。如果测试只评估可见表面,就可能给人一种虚假的准确感——不可见部分可能错得离谱,却完全不影响得分。
同样地,[3]聚焦于极度宽松的衣物和手持物体,这些会带来大面积遮挡和复杂形变,而紧身衣物基准测试则忽略了这些情况。他们的结果表明,仅靠通用人体先验知识是不够的;还需要针对视频的形变层来捕捉衣物的细微几何结构。因此,如果测试不包含此类具有挑战性的案例,就无法揭示模型实际上是在凭空臆造飘动外套或手持包袋的形状。
当相机偏离原始路径时会发生什么
单目视频仅捕捉到四维世界的一个狭窄切片,因此从新相机角度进行渲染的任何尝试都是不适定的。那些贴近原始视角的测试无法暴露这一问题,但大角度重定向往往以失败告终。[4]表明,基于扩散的方法在大角度变化下会失效,产生严重的几何模糊和时间不一致性。他们的解决方案是构建一个前景完整的四维代理作为结构锚定,从而在具有挑战性的轨迹下提升忠实度与连贯性。
这意味着,从原始相机路径观看时,重建结果可能看起来完美无缺,但一旦你围绕人物旋转视角,几何结构就可能发生扭曲或闪烁。仅与输入视图进行比较的标准评估指标完全无法捕捉到这一问题。[4]的实验专门测试了大角度轨迹,结果表明,如果没有额外的几何支撑,模型的输出会显著退化——而这种失败是常规测试无法发现的。
关于这些资料来源
本回答基于5项同行评审研究——发表于2023年至2026年间,其中3项为2024年或之后发表,合计被引用179次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的30篇文献。
本文引用的文献
4D-Fly:从单目视频快速进行4D重建
4D-Fly能够在大约6分钟内从数百帧的单目视频中重建出4D场景,声称相比以往的优化方法实现了超过20倍的加速,并且质量更高,但它仍然依赖于可能无法覆盖极端形变的数据先验。
无偏4D:基于神经变形模型的单目4D重建
Ub4D利用神经变形模型和场景流损失来处理遮挡区域中的大变形与形状补全,与先前工作相比,在表面精度和鲁棒性方面均有提升。
DressRecon:基于单目视频的自由形式4D人体重建
DressRecon针对极度宽松衣物和物体交互场景,将通用人体先验与视频特有的“骨骼袋”形变相结合,在具有挑战性的数据集上实现了比现有方法更高保真度的重建效果。
FreeOrbit4D:基于前景完整4D重建的单目视频免训练任意相机重定向
FreeOrbit4D表明,从单目视频进行大角度相机重定向常常因缺乏视觉锚定而失效,而其前景完整的4D代理在该类轨迹下提升了保真度与时间一致性。
人类4D:利用Transformer重建与追踪人类
4DHumans采用基于Transformer的人体网格恢复技术(HMR 2.0)来处理异常姿态,并能在遮挡情况下对多人进行持续跟踪,从而在单目视频中实现了最先进的跟踪效果。
