[CVPR 2026] CourtSI:让 AI 走进球场,挑战 3D 空间智能的新高峰
Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports
本文推出了 CourtSI,这是首个面向运动场景的大规模空间智能(Spatial Intelligence)数据集。该工作包含 1M 个 QA 对,涵盖羽毛球、网球和乒乓球,并提供高质量基准测试集 CourtSI-Bench,旨在评估视觉语言模型(VLMs)在动态、人体中心场景下的 3D 推理能力。
TL;DR
传统的 Vision-Language Models (VLMs) 在识别“这是什么”上已经炉火纯青,但在回答“这有多远”或“他在哪”等涉及 3D 空间智能 (Spatial Intelligence) 的问题时依然束手无策。本文介绍了 CourtSI,这是全球首个专注于运动场景的大规模 3D 空间推理数据集。通过引入球场几何作为物理锚点,研究者们构建了 100 万个精确的度量型 QA 对。实验证明,微调后的模型不仅在测量精度上突飞猛进,还能生成具有专业空间感的赛事解说。
痛点深挖:为什么 AI 在球场上会“迷路”?
现有的 3D 空间智能推理研究(如 SpatialVLM)多处于室内静态环境,物体多为桌椅等刚体。但在体育比赛中,AI 面临两大严峻挑战:
- 动态人体中心 (Human-centric):人体是非刚性的,高速运动中的肢体遮挡、透视形变让 3D 姿态估计极难。
- 度量缺失:单目图像缺乏绝对尺度。现有的 SOTA 深度估计模型(如 DepthAnythingV3)在处理高速飞行的球体或远端运动员时,往往会出现厘米甚至米级的误差,这在体育分析中是致命的。
核心方法:几何驱动的 3D 数据引擎
为了获得精确的“地面真理 (Ground Truth)”,作者设计了一套半自动重构流程,巧妙利用了体育场馆中“标准球场尺寸”这一物理先验。
1. 以球场为锚点的度量重建
作者通过人工标注球场四个角点及球网高度点,利用 PnP (Perspective-n-Point) 算法反推相机的内参和外参。这建立了一个统一的世界坐标系,使得图像中的每个像素都能映射到真实的物理坐标。
2. 人体与球体的深度修正
传统的单目深度估计经常让运动员“悬浮”或“陷地”。作者引入了 PromptHMR 进行人体网格恢复,并结合人工标注的足底/球体地面投影位置,通过透视变换(Similarity Transformation)对深度进行重标定,确保了 厘米级 (cm-level) 的定位精度。
图 1:CourtSI 数据引擎流程:从球场标注到人体网格恢复
实验战绩:微调带来的质变
研究团队测试了包括 GPT-5.2、Gemini-3-Pro 在内的 25 个顶尖模型。
- 人类 vs AI:即使最强的模型在距离测量 (Distance Measurement) 任务上也惨败于人类。人类虽不擅长绝对坐标,但利用球场规则建立的相对位置直觉远超目前的通用 VLM。
- 微调收益:将 Qwen3-VL-8B 在 CourtSI 上微调后,准确率惊人地提升了 23.5%。尤其是在距离测量任务中,T-MRA 指标实现了跨越式进步。
- 跨项泛化:虽然模型只在羽毛球、网球等数据上训练,但在全新的皮克球 (Pickleball) 测试集 CourtSI-Ext 上,依然保持了强大的推理能力,证明了空间感知的可迁移性。
表 1:VLMs 在 CourtSI-Bench 上的性能评估,微调后的模型显著领先
深度洞察:透视错觉——VLMs 的阿喀琉斯之踵
作者进行了一项深入的错误分析:透视歧义 (Perspective Ambiguity)。 当两个物体在 3D 空间中距离很远,但在 2D 图像平面上看起来很近时,模型极易判断错误。这说明当前的 VLM 仍然过度依赖图像平面的视觉邻近性(Visual Proximity),而缺乏真正的“空间深度感”。
图 2:随着透视歧义增加,所有模型的准确率均出现断崖式下跌
总结与展望
CourtSI 的价值不仅仅在于一个数据集,它展示了如何通过物理世界已知的几何约束去教导大模型理解 3D 空间。
- 未来解说:未来的 AI 体育解说不再只会复述“他打了一个好球”,而是能精准说出“这记扣杀在离身 3.5 米处完成,角度刁钻”。
- 具身智能启示:这一成果对于机器人足球、无人机转播等需要实时空间避障和定位的任务具有极高的参考价值。
该研究为我们展示了:当 AI 踏入赛场,它需要的不仅仅是文字的华丽,更是对物理尺度最深沉的敬畏。
