如何为主流多模态理解与生成评估主观质量?

如何在统一多模态AI中评估主观质量:使用人类对齐的基准测试、提示探测和领域特定测试。

直接答案

统一多模态理解与生成中的主观质量评估,不仅看准确率指标,更要检验模型输出是否符合人类感知与意图。最强有力的证据表明,当前模型往往并未真正理解提示词——它们只是在拟合训练数据——因此评估必须包含多样化提示词的探测以及领域专属基准测试。例如,对VQA数据进行提示词探测后发现,多模态大语言模型并未真正理解输入内容[1];而针对图表的专项测试则显示,在高质量指令数据上训练的模型,在图表问答、文本及抽取任务上均超越了此前所有方法[2]。在视频质量方面,一个在混合数据集上训练的统一模型,其预测结果在四个野外数据集上与人类主观评分保持一致[4]。因此,稳健的评估应结合人类对齐的基准、提示词变体以及领域专属任务。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何仅凭准确率指标无法衡量主观质量

主观质量关乎模型的输出在人类看来是否合理,而不仅仅是是否匹配某个标签。2023年的一项研究通过系统性地改变视觉提示、文本提示,并加入额外知识,在VQA(视觉问答)数据上对多模态大模型进行了测试。结果发现:现有模型并未真正理解输入——它们大多只是拟合训练数据的分布,因此当提示以需要真正理解的方式发生变化时,其性能就会崩溃[1]。这意味着,一个模型可能在标准基准测试中得分很高,但在实际应用中因提示多变而失败。因此,评估主观质量需要用多样化、出乎意料的提示进行测试,以观察模型行为是否符合人类预期,而不仅仅是检查它在固定题目上是否答对。

领域特定基准揭示生成质量差距

对于生成任务而言,主观质量取决于输出在特定领域中与人类期望的匹配程度。2025年一项关于图表理解与生成的研究利用GPT-4构建了高质量指令微调数据集,并在此基础上训练了ChartLlama模型。在标准基准测试——ChartQA、图表到文本以及图表提取——中,ChartLlama均优于此前所有方法[2]。这表明,当模型在多样化、高质量的指令上训练时,其输出能够更好地契合人类在该领域的期望。但关键在于评估方式:需要使用覆盖多种图表类型和任务的基准,而非仅依赖单一狭窄的测试。因此,对于生成任务的主观质量评估,你需要能够反映真实世界输入与输出全貌的基准,并且需要与人类判断进行对比,而不仅仅是依赖自动化评分。

与人类感知对齐:来自视频质量评估的启示

在视频质量评估中,主观质量由人类评分来定义。一项2021年的研究通过同时在多个数据集上训练统一模型,解决了对自然场景视频(无参考、复杂失真)进行评估的挑战。该研究明确建模了人类感知——内容依赖性和时间记忆效应——并将预测结果与主观质量评分对齐。该模型在四个公开数据集(LIVE-VQC、LIVE-Qualcomm、KoNViD-1k、CVD2014)上均优于现有最先进方法[4]。这表明,要评估主观质量,需要一个经过训练以预测人类评分的模型,而不仅仅是客观失真指标。同样的原则也适用于多模态理解与生成:你需要人工标注的质量评分或人类偏好数据来训练和评估模型,并且需要考虑内容和上下文的影响。

多模态特征对主观理解至关重要

多模态任务中的主观质量往往取决于模型如何整合视觉与语言线索。2024年一项关于模因理解的研究认为,模因中的隐喻需要联合建模视觉与语言特征,而非仅依赖文本。他们提出了一种方法,通过从语言属性中推导视觉特征来生成多模态隐喻特征,并采用文本条件生成对抗网络实现。在MET-Meme基准上,该方法在情感分类和意图检测方面显著优于基线模型[3]。这表明,对于主观理解——例如把握模因的预期含义——评估必须检验模型能否以捕捉潜在隐喻的方式融合视觉与文本信息。如果模型仅使用文本,就会遗漏视觉语境,从而导致主观质量不佳。

关于这些来源

本回答基于5项同行评审研究——发表于2021年至2025年间,其中2项为2024年或之后发表,2项发表于Q1期刊,合计被引用250次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的40篇文献。

本文引用的文献

1

多模态大语言模型的局限性是什么?通过提示探针深入探究多模态大语言模型

对VQA数据的提示探测表明,现有多模态大语言模型并未真正理解输入内容,而只是拟合训练数据分布,这说明其缺乏主观理解能力。

2

用于图表理解与生成的多模态大语言模型

ChartLlama在GPT-4生成的指令微调数据集上训练,在ChartQA、图表转文本和图表提取基准测试中均优于所有先前方法,表明高质量领域特定训练数据能提升生成质量。

3

生成多模态隐喻特征以理解模因

一种生成多模态隐喻特征(MMMC)的方法在MET-Meme基准的情感分类和意图检测任务上显著优于基线模型,表明视觉与语言的联合建模能够提升主观理解能力。

4

使用混合数据集训练对野外视频进行统一质量评估

在混合数据集上训练并显式对齐感知特性的统一视频质量评估模型,在四个真实场景视频数据集上均优于现有最优模型,表明与人类感知对齐的训练方式能够提升主观质量预测的准确性。

5

基于大语言模型的多模态交通事故预测

在交通事故预测中,采用具备深度概率推理能力的大型多模态模型(LLaVA)提升了实时响应性能,这表明多模态融合能够改善自动驾驶中的主观决策能力。