[arXiv 2025] AudioCapBench:打破传统指标瓶颈,深度测评 LMM 的音频感知力
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
本文推出了 AudioCapBench,这是一个专门用于评估多模态大模型(LMMs)音频字幕生成能力的基准测试集。该基准涵盖了环境音、音乐和语音三大领域,共 1,000 个精选样本,并引入了基于 LLM-as-Judge 的多维度评估框架,在测试中 Google Gemini 3 Pro 取得了 SOTA 成就。
TL;DR
本文由 Salesforce AI Research 团队发布,推出了 AudioCapBench —— 一个针对大语言模型(LMM)音频字幕生成能力的深度基准测试。研究通过对 13 款主流模型(包括 OpenAI 与 Google Gemini 系列)在环境音、音乐、语音三大场景下的测评,揭示了当前顶尖 AI 在音频理解上的真实水平:Gemini 3 Pro 目前领跑全场,而音乐感知依然是全行业的共同短板。
核心痛点:音频描述不仅是“看词说话”
在音频字幕生成(Audio Captioning)任务中,模型需要识别声源、描述音乐属性、捕捉发言人情绪及时间空间关系。
传统的评估方式存在两大致命缺陷:
- 维度局域化:过去的研究往往只关注环境音(Environmental Sound),忽略了结构复杂的音乐和信息密集的语音。
- 指标失效:传统的 BLEU 或 ROUGE 等指标依赖于字面重合。例如,模型说“烟花绽放”,参考答案是“连续的爆炸声”,由于词汇不匹配,模型即使描述得再准确也会被判定为低分(Lexical Overlap 局限性)。
方法论:三位一体的 LLM-as-Judge 框架
为了更公平地评价原生支持音频输入的 LMM,作者放弃了单一的文本指标,采用了基于 GPT-4.1 作为裁判的自动化评分系统。该系统从三个正交维度进行评估:
- Accuracy (精度):语义是否正确?(对应查准率 Precision)
- Completeness (完整性):是否涵盖了所有关键元素?(对应查回率 Recall)
- Hallucination (幻觉):是否凭空捏造了音频中不存在的内容?(对应虚警率 FPR)
图 1:AudioCapBench 涵盖的三大领域:环境音、音乐、语音。
此外,针对不同音频,Prompt 会进行动态调整。例如在音乐类别中,裁判会重点检查流派、乐器、节奏和情绪是否被正确识别。
实验分析:谁才是真正的“金耳朵”?
1. 总体表现:Gemini 统治榜单
在综合评分中,Google Gemini 系列展现了强劲的实力,包揽了前三名。Gemini 3 Pro 在准确性和完整性上均表现出色,而 OpenAI 的模型(如 GPT-4o-audio)在抑制幻觉方面表现更好。
图 2:13 款模型的 LLM Judge 评分分布,Gemini 系列(蓝色)明显占优。
2. 领域差异:最难啃的骨头是音乐
实验数据表明(见图 3):
- 语音 (Speech):表现最佳。模型往往能通过识别出的文本内容反推场景。
- 环境音 (Sound):模型间的差距拉开最明显的地方,体现了基础声学特征提取的功力。
- 音乐 (Music):全线滑铁卢。即便最强的 Gemini 3 Pro,其得分也显著低于其他类别,说明 AI 对音乐理论和复杂配器的理解仍处于初级阶段。
图 3:各模型在不同音频分类下的得分对比,音乐类别普遍处于低位。
3. 深度发现:OpenAI mini 模型的“缄默症”
研究发现了一个有趣的现象:GPT-4o-mini 等小型模型在“幻觉”维度得分极高。这并不是因为它们真的懂了,而是因为它们采取了极其保守的策略——只输出非常简短、通用的描述。这种“宁肯白卷,绝不写错”的做法导致其 Accuracy 和 Completeness 得分惨不忍睹(见图 4)。
图 4:Accuracy vs Hallucination 的分布。OpenAI mini 模型聚集在左上角(低准确度,低幻觉)。
总结与展望
AudioCapBench 的出现为多模态音频研究提供了一把更客观的“尺子”。它证明了音频理解不仅仅是 ASR 的延伸,而是一个包含语义推理和跨模态感知的复杂过程。
资深编辑点评: 该研究最重要的启示在于:不要迷信 Lexical Metrics。 在 LMM 时代,我们需要像 AudioCapBench 这样能够感知“语义一致性”而非“字面重复性”的评估方案。同时,对于开发者而言,如何提升模型在音乐领域的细粒度理解,以及如何在不牺牲内容丰富度的前提下降低幻觉,将是下一个 SOTA 的关键点。
论文发布于 Salesforce AI Research。开源地址:https://github.com/SalesforceAIResearch/AudioCapBench
