[CVPR 2026] 视觉模型真的懂几何吗?揭秘 VLM 内部隐藏的“物理精密尺”
Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement
本文通过对 14 种视觉语言模型(VLM)和视觉编码器的冻结特征进行线性探针(Linear Probe)实验,发现模型内部编码了精确的连续几何信息(如关节角度、头姿等)。核心结论是:文本输出路径存在严重的“几何瓶颈”,通过冻结特征提取的精度比文本输出高 3.3 倍,且训练目标比模型架构更能决定几何感知能力。
TL;DR
你以为你的 VLM 是个“空间盲”?其实它只是“表达障碍”。最新研究发现,像 SigLIP 2 或 DINOv3 这样的视觉模型,其内部特征对连续几何(如手部关节角度)的感知精度极高。通过一个极小的线性探针,我们可以提炼出比文本输出精确 3 倍以上的测量结果。研究证明,这种几何能力的差异主要源于训练目标,而非模型架构。
背景定位:被低估的视觉表征
在当前的学术界,大家倾向于通过多轮对话(CoT)来增强 VLM 的空间能力。然而,本文一针见血地指出:几何感知就在那里,只是文本路径把它弄丢了。 该工作在学术坐标系中属于典型的“表征探测(Probing)”研究,旨在量化视觉基础模型作为“几何传感器”的真实潜力。
痛点深挖:文本路径的“降级”
开发者经常发现,问 VLM “手部关节弯曲了多少度?”,模型给出的数字往往张冠李戴。
- 现状:即使是 SOTA 模型,文本输出的平均绝对误差(MAE)也在 20° 以上。
- 直觉:作者猜测,视觉编码器已经捕获了像素间的拓扑关系,但为了适配文本 Tokenizer 的离散分布,这些连续的几何信号在解码阶段被过滤掉了。
核心方法:线性探针与功能收敛
作者并没有修改任何模型参数,而是直接在冻结的特征(Frozen Features)上加上了一个只有约 6000 参数的**降低秩回归(Reduced-Rank Regression, RRR)**层。
1. 架构解析
实验覆盖了从 CNN(ConvNeXt)到 ViT 的多种架构,以及从 DINO(自监督)到 SigLIP(对比学习)的多种路径。

2. 功能收敛(Functional Convergence)
一个极其惊人的发现是:五个表征完全不同的模型(CKA 相似度仅 0.41),在几何预测的 R² 上竟然奇迹般地统一在 0.55 左右。这意味着,无论模型内部如何组织数据,最终它们都提取出了相同的物理规律。 这有力地支持了“柏拉图表征假设”——即高性能模型都在趋向于对现实世界的统一建模。
实验战绩:精度全方位碾压
实验对比了“原生文本输出”、“LoRA 微调”和“线性探针”的效果:
| 模式 | MAE (越小越好) | 解析率 |
|---|---|---|
| 文本Few-shot | 20.0° | 不稳定 |
| 冻结线性探针 | 6.14° | 100% |
| LoRA微调文本 | 6.51° | 100% |

关键发现:
- 训练目标 > 架构:对比消融实验显示,同样的参数量,自监督/对比学习模型比纯监督学习模型(如 ImageNet 预训练)高出 0.15 R²。
- LLM 的副作用:对于 Qwen 或 Gemma 等模型,在进入 LLM 解码器后,手部这种精细几何信息会随层数增加而快速衰减(见下方层轨迹图)。

深度洞察:工业界的“省钱”配方
这项研究为开发者提供了一个极具性价比的方案:
- 模块化传感器:你不需要为每个几何任务(手势、头姿、物体位姿)训练专用模型。
- 极简适配:只需准备几千张标注图像,在现有的基础模型(如 SigLIP 2)提取特征,训练一个几千参数的线性层(几 KB 大小),就能获得媲美专业模型的测量精度。
总结与局限
Takeaway:VLM 不缺几何知识,缺的是“读数设备”。 局限性:尽管 R² 达到了 0.55,但仍有 45% 的方差无法解释,特别是在目标分布方差极小的任务(如拇指关节)中,冻结特征的表现依然挣扎。另外,对于空间极其弥散的信号(如 BIWI 的 Roll 角),这种方法需要配合 Attention Pooling 才能生效。
本文为学术前沿解读,旨在揭示基础模型背后的物理直觉。
