[arXiv 2025] AudioCapBench:打破传统指标瓶颈,深度测评 LMM 的音频感知力

AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech

总结
问题
方法
结果
要点
摘要

本文推出了 AudioCapBench,这是一个专门用于评估多模态大模型(LMMs)音频字幕生成能力的基准测试集。该基准涵盖了环境音、音乐和语音三大领域,共 1,000 个精选样本,并引入了基于 LLM-as-Judge 的多维度评估框架,在测试中 Google Gemini 3 Pro 取得了 SOTA 成就。

TL;DR

本文由 Salesforce AI Research 团队发布,推出了 AudioCapBench —— 一个针对大语言模型(LMM)音频字幕生成能力的深度基准测试。研究通过对 13 款主流模型(包括 OpenAI 与 Google Gemini 系列)在环境音、音乐、语音三大场景下的测评,揭示了当前顶尖 AI 在音频理解上的真实水平:Gemini 3 Pro 目前领跑全场,而音乐感知依然是全行业的共同短板。

核心痛点:音频描述不仅是“看词说话”

在音频字幕生成(Audio Captioning)任务中,模型需要识别声源、描述音乐属性、捕捉发言人情绪及时间空间关系。

传统的评估方式存在两大致命缺陷:

  1. 维度局域化:过去的研究往往只关注环境音(Environmental Sound),忽略了结构复杂的音乐和信息密集的语音。
  2. 指标失效:传统的 BLEU 或 ROUGE 等指标依赖于字面重合。例如,模型说“烟花绽放”,参考答案是“连续的爆炸声”,由于词汇不匹配,模型即使描述得再准确也会被判定为低分(Lexical Overlap 局限性)。

方法论:三位一体的 LLM-as-Judge 框架

为了更公平地评价原生支持音频输入的 LMM,作者放弃了单一的文本指标,采用了基于 GPT-4.1 作为裁判的自动化评分系统。该系统从三个正交维度进行评估:

  • Accuracy (精度):语义是否正确?(对应查准率 Precision)
  • Completeness (完整性):是否涵盖了所有关键元素?(对应查回率 Recall)
  • Hallucination (幻觉):是否凭空捏造了音频中不存在的内容?(对应虚警率 FPR)

评估框架逻辑图 图 1:AudioCapBench 涵盖的三大领域:环境音、音乐、语音。

此外,针对不同音频,Prompt 会进行动态调整。例如在音乐类别中,裁判会重点检查流派、乐器、节奏和情绪是否被正确识别。

实验分析:谁才是真正的“金耳朵”?

1. 总体表现:Gemini 统治榜单

在综合评分中,Google Gemini 系列展现了强劲的实力,包揽了前三名。Gemini 3 Pro 在准确性和完整性上均表现出色,而 OpenAI 的模型(如 GPT-4o-audio)在抑制幻觉方面表现更好。

模型排行榜 图 2:13 款模型的 LLM Judge 评分分布,Gemini 系列(蓝色)明显占优。

2. 领域差异:最难啃的骨头是音乐

实验数据表明(见图 3):

  • 语音 (Speech):表现最佳。模型往往能通过识别出的文本内容反推场景。
  • 环境音 (Sound):模型间的差距拉开最明显的地方,体现了基础声学特征提取的功力。
  • 音乐 (Music):全线滑铁卢。即便最强的 Gemini 3 Pro,其得分也显著低于其他类别,说明 AI 对音乐理论和复杂配器的理解仍处于初级阶段。

领域表现对比 图 3:各模型在不同音频分类下的得分对比,音乐类别普遍处于低位。

3. 深度发现:OpenAI mini 模型的“缄默症”

研究发现了一个有趣的现象:GPT-4o-mini 等小型模型在“幻觉”维度得分极高。这并不是因为它们真的懂了,而是因为它们采取了极其保守的策略——只输出非常简短、通用的描述。这种“宁肯白卷,绝不写错”的做法导致其 Accuracy 和 Completeness 得分惨不忍睹(见图 4)。

准确性与幻觉的权衡 图 4:Accuracy vs Hallucination 的分布。OpenAI mini 模型聚集在左上角(低准确度,低幻觉)。

总结与展望

AudioCapBench 的出现为多模态音频研究提供了一把更客观的“尺子”。它证明了音频理解不仅仅是 ASR 的延伸,而是一个包含语义推理和跨模态感知的复杂过程。

资深编辑点评: 该研究最重要的启示在于:不要迷信 Lexical Metrics。 在 LMM 时代,我们需要像 AudioCapBench 这样能够感知“语义一致性”而非“字面重复性”的评估方案。同时,对于开发者而言,如何提升模型在音乐领域的细粒度理解,以及如何在不牺牲内容丰富度的前提下降低幻觉,将是下一个 SOTA 的关键点。


论文发布于 Salesforce AI Research。开源地址:https://github.com/SalesforceAIResearch/AudioCapBench

发现相似论文

试试这些示例

  • 查找最近其他针对多模态大模型音频理解能力(Audio Understanding)进行 LLM-as-Judge 评估的相关研究报告。
  • 哪篇论文最早系统性地分析了多模态模型在生成任务中的“保守性与幻觉”权衡问题?
  • 探索目前专门针对音乐信息检索(MIR)与大模型结合以提升音乐字幕生成(Music Captioning)准确性的最新方法。
目录
[arXiv 2025] AudioCapBench:打破传统指标瓶颈,深度测评 LMM 的音频感知力
1. TL;DR
2. 核心痛点:音频描述不仅是“看词说话”
3. 方法论:三位一体的 LLM-as-Judge 框架
4. 实验分析:谁才是真正的“金耳朵”?
4.1. 1. 总体表现:Gemini 统治榜单
4.2. 2. 领域差异:最难啃的骨头是音乐
4.3. 3. 深度发现:OpenAI mini 模型的“缄默症”
5. 总结与展望