哪些隐性成本会让面向OOD目标检测的结构化先验知识比看起来更难用?

用于OOD目标检测的结构化先验知识隐藏了成本:标签工程、评分不匹配以及训练复杂性,这些都可能侵蚀其带来的收益。

直接答案

用于分布外(OOD)目标检测的结构化先验知识看似即插即用,实则暗藏真实代价:你必须精心设计正确的负标签,根据模型的输出类型调整评分函数,并管理训练复杂度。例如,一种方法在COCO上将误报率降低了11.4%,在OpenImages上降低了25.5%,但前提是加入了由大语言模型生成的负标签以及自定义的基于sigmoid的评分[2]。另一种方法合成虚拟OOD特征,但需要仔细调整可学习的码字和扩散过程,以免损害分布内性能[1]。第三项研究则警告称,加入人工定义的相似性排序实际上可能削弱OOD检测效果,这表明并非所有先验知识都有帮助[3]

3篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

隐藏的代价:你必须设计正确的负标签

结构化的先验知识往往意味着给模型灌输一份“什么不是”的清单。但这份清单并非免费——它需要精心挑选。在一种方法中,作者利用大语言模型生成与分布内类别视觉相似但语义不同的负标签(例如,“卡车”对“公交车”)[2]。这是一个隐藏成本,因为你需要设计和验证这些标签;泛泛的负样本行不通。回报是实实在在的:在COCO数据集上,这将95%召回率下的假阳性率(FPR95)降低了11.4%,在OpenImages上降低了25.5%[2]。所以,成本在于前期的工程投入,但收益是误报率的大幅下降。

评分函数不匹配:你的OOD分数可能并不适配你的模型

第二个隐藏成本在于,你的OOD评分方法必须与检测器输出概率的方式相匹配。许多检测器使用sigmoid函数进行多标签分类,但经典的OOD评分假设的是softmax输出。论文指出了这种不兼容性:在基于sigmoid的检测器上使用基于softmax的评分,会导致分布内与OOD实例之间的区分度很差[2]。他们通过设计一种新的基于sigmoid的评分函数解决了这个问题,该函数同时利用正标签和负标签,对已知对象产生强烈响应,对未知对象则抑制响应[2]。教训是:你不能简单地把现成的OOD评分直接套上去;你需要根据模型的架构进行调整,这既增加了额外的工作量,如果忽视这一点,也可能成为潜在的失败源。

训练复杂度:更多环节、更多调参,有时结果反而更差

结构化知识方法往往需要添加复杂的训练组件,若调优不当反而可能适得其反。一种做法是利用可学习的码字来提取对象知识,并通过扩散过程合成虚拟的OOD特征[1]。这显著增加了复杂性——你需要训练码字、构建未知概念池,并运行反向扩散过程——同时还要避免分布内性能的退化[1]。作者报告了显著的性能提升,但复杂性在计算和超参数调优方面是隐性的成本。更糟的是,另一项研究发现,将人类定义的相似性排序纳入对比学习反而损害了OOD检测性能[3]。这是一个鲜明的警示:并非所有结构化先验知识都有益,有些甚至会主动误导模型。关键在于,你需要验证所选先验是否确实有帮助,并准备好承担额外的训练开销。

关于这些来源

这个回答基于3项研究(1篇同行评审,2篇预印本),发表于2022年至2026年间,其中2篇为2024年或之后发表,1篇发表于Q1期刊。这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的45篇文献。

本文引用的文献

1

面向OOD目标检测的未知概念引导特征扩散

提出UCFD方法,利用可学习码字提取对象知识,并通过扩散过程合成虚拟OOD特征,在三个任务上取得了显著的性能提升,同时指出需注意避免对分布内检测性能的退化。

2

NegAS:基于负标签引导的注意力与评分机制,用于视觉-语言模型下的分布外目标检测

针对基于VLM的检测器,提出了NegAS方法,利用大语言模型生成的负标签来引导注意力,并采用基于sigmoid的OOD评分函数,与基线相比,在COCO上将FPR95降低了11.4%,在OpenImages上降低了25.5%。

3

用于目标检测中分布外检测的对比学习

表明将人类定义的相似度排序融入对比学习,可以提升分类和检测任务的表示学习效果,但实际上会损害OOD检测性能,这凸显了使用有偏先验的风险。